ก็เกริ่นก่อนเลยละกันครับ
ถ้าจะเล่นโมเดลทั่วไป Gemini-3.7, Deepseek V4 Flash, ก็ซื้อ API เอาเถอะครับ, ถูกมากกก
ลองหาดูบน OpenRouter, โมเดล Parameter มันสูงแบบไม่สามารถ Host เองได้เลย, แล้วคือมันตอบสนองได้เร็วมาก (ถ้าเลือก Provider ดีๆ)
เร็วพอๆ กับเอาโมเดลเล็กๆ มารันบนการ์ดจอบ้าน, แต่มันจะหลุด Context ยากกว่าเยอะ
API ฟรี ยังมีเลยครับพวก Nvidia Nemotron, Nemotron Ultra 550B (MoE-55B), Nemotron Super 120B (MoE-12B)
เผื่อใครอยากจะลองเล่น Agentic AI สายฟรี, รัน OpenClaw, Hermes Agent, แต่คุณต้องสู้กับ Latency และ Error 429 - Too Many Requests หน่อย
สำหรับผมตอนนี้เล่น LLM แบบ Roleplay เป็นหลักครับ, ก็เน้นแชทสวมบทบาทนั่นแหละ
คือจะไปขอ API ฟรีจาก Google AI Studio มาก็ได้นะ, Rate limit วันนึงก็เล่นไม่หมดหรอก, โมเดลมันคิดเป็นภาษาไทยได้, ใช้ภาษาไทยได้เนียนมาก
แต่มันมีข้อเสีย คือเพราะ Gemini มันเป็นโมเดลสำหรับการตอบคำถามแบบ ตรงไป-ตรงมา อารมณ์ร่วมมันก็ดีแหละ
แต่ไม่สุดเท่าโมเดล Finetuned ที่ทำมาเฉพาะสำหรับ Creative Writing, Roleplay
มันจะให้ฟีลการโต้ตอบที่ดีกว่าถึงแม้บางทีจะต้องเรียก LLM อีกตัวมาช่วยแปลเป็นภาษาไทยกลับก็ตาม
เพราะโมเดล Roleplay รุ่นที่นิยมจะมี Base Model เป็น Mistral กับ LLama,
ที่ช่วง Parameter 8B ถึง 24B, มันไม่เก่งภาษาไทย ตอบได้นะแต่จะอังกฤษปนไทย เต็มที่แล้ว
ถ้า Base Model เป็น Gemma 4 (หรืออาจจะ Qwen ด้วย) อันนี้ตอบไทยกลับได้ทั้งหมดเลย
อีกอย่างคือ โมเดล Finetuned พวกนี้มีแค่ส่วนน้อยแหละ ที่จะถูก Host อยู่บน OpenRouter
ถ้ามีก็แค่ 1 Provider, บางทีส่งคำขอไปก็ติด Error 429 - Too Many Requests, เลยรันเองซะ
โมเดลที่ใช้เปรียบเทียบ
Finetuned : TheDrummer_Anubis-Mini-8B-v1-IQ4_NL.gguf - 4.77 GB
Base Model : allura-forge/Llama-3.3-8B-Instruct
Memory Bandwidth
Radeon 760M - DDR5-5600, 32bit (single-channel) - 22.4 GB/s
RX 480 - GDDR5, 256bit – 256.0 GB/s
Arc B580 - GDDR6, 192bit – 456.0 GB/s
RX 9070 XT - GDDR6, 256bit – 644.6 GB/s
Radeon 760M (iGPU) จะชน RX 480 อยู่แล้ว
ถ้าเป็นพวก CPU ที่ชื่อ Ryzen AI, NPU จะเป็นสถาปัตย์กรรม XDNA2, พวกนี้จะใช้ FastFlowLM รันโมเดล LLM บน NPU ได้โดยตรง
โมเดลที่รันได้ขึ้นกับโปรแกรม รันได้แต่โมเดลหลักๆ ตัวเล็กๆ การบีบอัดถูกเลือกไว้ล่วงหน้า, ตัวโมเดล Merges Finetuned แปลกๆจะไม่สามารถรันได้
แนวคิด Unified Memory ก็ดีนะคือเรายัด RAM ไปมากเท่าไร, จะยิ่งรันโมเดลได้ใหญ่ขึ้นเท่านั้น, แต่จะแลกมาด้วย เพราะ iGPU มันสร้างโทเคนได้ช้าอยู่แล้ว
ยิ่งรันโมเดลใหญ่จะยิ่งช้าลง, iGPU ควรจะใช้โมเดลประมาณ 4B สำหรับผมนะมันเร็วพอดีอยู่แถวๆนั้น, พอดี RAM หมด 16GB
คิดว่าเต็มที่ 12B คงช้าจนรอกันไม่ไหว, แล้วก็สามารถโหลดโมเดลลง RX 480 8GB ได้ทั้งตัวนะครับ, ไม่ได้มีปัญหาอะไร, มันทำได้แค่นั้นแหละ
Arc B580 เป็นอะไรที่น่างงนะ, SYCL ที่ถูกทำมาเฉพาะเพื่อ Intel แรงจริงแค่ตอน Prompt processing, ตอนสร้าง token เพื่อตอบกลับมา กลับช้าลง
ค่าแรกตกอ่ะยอมรับได้ แต่ค่าหลังต้องเพิ่มนะ นี่กลับกัน, ควรจะใช้ Vulkan มันดูสมดุลมากกว่า, XMX Core ที่ใส่มาช่วยเร่งการคำนวณ ไม่มีความหมายอะไร เพราะไม่ได้ใช้, ไม่มีจุดที่เหมาะสม
RX 9070 XT ก็เหมือนกับข้างบน, ROCm ที่ถูกทำมาเฉพาะเพื่อ AMD ยังอยู่ในช่วงการพัฒนาให้เข้ากับ RDNA 4 ทำให้ดูไม่ค่อยเร็วนัก,
ถ้าใช้ Vulkan จะให้ผลลัพธ์ที่ดีกว่า, Matrix Core ที่ใส่มาช่วยเร่งการคำนวณ ถูก Vulkan ใช้จริงๆ ก็คิดว่าสุดมากแล้วล่ะ,
ถ้า ROCm ทำงานเข้ากับ RDNA 4 ได้แล้ว, คงจะทำ Prompt Processing เร็วขึ้นอีกหน่อย
เห็นผลอันนี้แล้วใจฟูมากถึงแม้เทียบกันจะแพ้ RTX 5070 Ti ขาดแน่ๆ เพราะชิพแรม 5070 Ti มันเป็น GDDR7,
RX 9070XT Bandwidth กว้างประมาณ 2/3 ของ RTX 5070 Ti แต่ถึงจะเร็วแค่ไหนก็ตัน VRAM
เพิ่มเติมสำหรับแนวคิดของผม ต่อการ์ด
RADEON AI PRO 9700, ตัว GPU มันแรงเท่าชิพของ 9070 XT แหละ
เม็ดแรมก็ชนิดเดียวกัน GDDR6, Buswidth Bandwidth เท่ากันเป๊ะ, งั้นคือความเร็วการประมวลผลมันเท่ากับ 9070 XT แหละ
แต่ AI PRO 9700 VRAM จะเพิ่มเป็นสองเท่า 32 GB, จะทำให้มันรันโมเดลที่ขนาดใหญ่มากขึ้นได้ โดยไม่ถูก Offload ไป CPU
แต่รันโมเดลเต็มที่ก็ไม่เกิน 49B, Q4_K_M,
TheDrummer_Valkyrie-49B-v2.1-Q4_K_M.gguf - 30.2 GB + KV Cache (Context Size ไม่เยอะเท่าไร) + Buffer = VRAM หมด
ถ้าอยากได้ Context Size เพิ่มต้องลดไซส์โมเดล 49B, Q4_K_S,
TheDrummer_Valkyrie-49B-v2.1-Q4_K_S.gguf - 28.6 GB, อะไรก็ว่าไป แลกกับ Perplexity Loss ที่เพิ่มขึ้น
เสียเงินซื้อ API เหอะครับ 5555 ถูกกว่าเยอะ ถ้าจะใช้โมเดลทั่วไปอ่ะ, เร็วกว่าด้วยเพราะโมเดลมันอยู่บนเม็ดแรม HBM
ถ้ากังวลเรื่องความเป็นส่วนตัว, อยากรันโมเดลเฉพาะทาง หรือต้องรันโมเดล 24/7 ก็อีกเรื่องครับ
อีกทางเลือกคือเช่า Cloud GPU เหมาะนะสำหรับอารมณ์แบบ อยากลองเล่นโมเดลใหญ่ๆ ถ้าคิดว่าเล่นไม่นานก็คงเลิก
เปรียบเทียบความเร็วการรัน Local LLM ด้วย CPU, GPU, iGPU
ลองหาดูบน OpenRouter, โมเดล Parameter มันสูงแบบไม่สามารถ Host เองได้เลย, แล้วคือมันตอบสนองได้เร็วมาก (ถ้าเลือก Provider ดีๆ)
เร็วพอๆ กับเอาโมเดลเล็กๆ มารันบนการ์ดจอบ้าน, แต่มันจะหลุด Context ยากกว่าเยอะ
API ฟรี ยังมีเลยครับพวก Nvidia Nemotron, Nemotron Ultra 550B (MoE-55B), Nemotron Super 120B (MoE-12B)
เผื่อใครอยากจะลองเล่น Agentic AI สายฟรี, รัน OpenClaw, Hermes Agent, แต่คุณต้องสู้กับ Latency และ Error 429 - Too Many Requests หน่อย
สำหรับผมตอนนี้เล่น LLM แบบ Roleplay เป็นหลักครับ, ก็เน้นแชทสวมบทบาทนั่นแหละ
คือจะไปขอ API ฟรีจาก Google AI Studio มาก็ได้นะ, Rate limit วันนึงก็เล่นไม่หมดหรอก, โมเดลมันคิดเป็นภาษาไทยได้, ใช้ภาษาไทยได้เนียนมาก
แต่มันมีข้อเสีย คือเพราะ Gemini มันเป็นโมเดลสำหรับการตอบคำถามแบบ ตรงไป-ตรงมา อารมณ์ร่วมมันก็ดีแหละ
แต่ไม่สุดเท่าโมเดล Finetuned ที่ทำมาเฉพาะสำหรับ Creative Writing, Roleplay
มันจะให้ฟีลการโต้ตอบที่ดีกว่าถึงแม้บางทีจะต้องเรียก LLM อีกตัวมาช่วยแปลเป็นภาษาไทยกลับก็ตาม
เพราะโมเดล Roleplay รุ่นที่นิยมจะมี Base Model เป็น Mistral กับ LLama,
ที่ช่วง Parameter 8B ถึง 24B, มันไม่เก่งภาษาไทย ตอบได้นะแต่จะอังกฤษปนไทย เต็มที่แล้ว
ถ้า Base Model เป็น Gemma 4 (หรืออาจจะ Qwen ด้วย) อันนี้ตอบไทยกลับได้ทั้งหมดเลย
อีกอย่างคือ โมเดล Finetuned พวกนี้มีแค่ส่วนน้อยแหละ ที่จะถูก Host อยู่บน OpenRouter
ถ้ามีก็แค่ 1 Provider, บางทีส่งคำขอไปก็ติด Error 429 - Too Many Requests, เลยรันเองซะ
โมเดลที่ใช้เปรียบเทียบ
Finetuned : TheDrummer_Anubis-Mini-8B-v1-IQ4_NL.gguf - 4.77 GB
Base Model : allura-forge/Llama-3.3-8B-Instruct
Memory Bandwidth
Radeon 760M - DDR5-5600, 32bit (single-channel) - 22.4 GB/s
RX 480 - GDDR5, 256bit – 256.0 GB/s
Arc B580 - GDDR6, 192bit – 456.0 GB/s
RX 9070 XT - GDDR6, 256bit – 644.6 GB/s
Radeon 760M (iGPU) จะชน RX 480 อยู่แล้ว
ถ้าเป็นพวก CPU ที่ชื่อ Ryzen AI, NPU จะเป็นสถาปัตย์กรรม XDNA2, พวกนี้จะใช้ FastFlowLM รันโมเดล LLM บน NPU ได้โดยตรง
โมเดลที่รันได้ขึ้นกับโปรแกรม รันได้แต่โมเดลหลักๆ ตัวเล็กๆ การบีบอัดถูกเลือกไว้ล่วงหน้า, ตัวโมเดล Merges Finetuned แปลกๆจะไม่สามารถรันได้
แนวคิด Unified Memory ก็ดีนะคือเรายัด RAM ไปมากเท่าไร, จะยิ่งรันโมเดลได้ใหญ่ขึ้นเท่านั้น, แต่จะแลกมาด้วย เพราะ iGPU มันสร้างโทเคนได้ช้าอยู่แล้ว
ยิ่งรันโมเดลใหญ่จะยิ่งช้าลง, iGPU ควรจะใช้โมเดลประมาณ 4B สำหรับผมนะมันเร็วพอดีอยู่แถวๆนั้น, พอดี RAM หมด 16GB
คิดว่าเต็มที่ 12B คงช้าจนรอกันไม่ไหว, แล้วก็สามารถโหลดโมเดลลง RX 480 8GB ได้ทั้งตัวนะครับ, ไม่ได้มีปัญหาอะไร, มันทำได้แค่นั้นแหละ
Arc B580 เป็นอะไรที่น่างงนะ, SYCL ที่ถูกทำมาเฉพาะเพื่อ Intel แรงจริงแค่ตอน Prompt processing, ตอนสร้าง token เพื่อตอบกลับมา กลับช้าลง
ค่าแรกตกอ่ะยอมรับได้ แต่ค่าหลังต้องเพิ่มนะ นี่กลับกัน, ควรจะใช้ Vulkan มันดูสมดุลมากกว่า, XMX Core ที่ใส่มาช่วยเร่งการคำนวณ ไม่มีความหมายอะไร เพราะไม่ได้ใช้, ไม่มีจุดที่เหมาะสม
RX 9070 XT ก็เหมือนกับข้างบน, ROCm ที่ถูกทำมาเฉพาะเพื่อ AMD ยังอยู่ในช่วงการพัฒนาให้เข้ากับ RDNA 4 ทำให้ดูไม่ค่อยเร็วนัก,
ถ้าใช้ Vulkan จะให้ผลลัพธ์ที่ดีกว่า, Matrix Core ที่ใส่มาช่วยเร่งการคำนวณ ถูก Vulkan ใช้จริงๆ ก็คิดว่าสุดมากแล้วล่ะ,
ถ้า ROCm ทำงานเข้ากับ RDNA 4 ได้แล้ว, คงจะทำ Prompt Processing เร็วขึ้นอีกหน่อย
เห็นผลอันนี้แล้วใจฟูมากถึงแม้เทียบกันจะแพ้ RTX 5070 Ti ขาดแน่ๆ เพราะชิพแรม 5070 Ti มันเป็น GDDR7,
RX 9070XT Bandwidth กว้างประมาณ 2/3 ของ RTX 5070 Ti แต่ถึงจะเร็วแค่ไหนก็ตัน VRAM
เพิ่มเติมสำหรับแนวคิดของผม ต่อการ์ด RADEON AI PRO 9700, ตัว GPU มันแรงเท่าชิพของ 9070 XT แหละ
เม็ดแรมก็ชนิดเดียวกัน GDDR6, Buswidth Bandwidth เท่ากันเป๊ะ, งั้นคือความเร็วการประมวลผลมันเท่ากับ 9070 XT แหละ
แต่ AI PRO 9700 VRAM จะเพิ่มเป็นสองเท่า 32 GB, จะทำให้มันรันโมเดลที่ขนาดใหญ่มากขึ้นได้ โดยไม่ถูก Offload ไป CPU
แต่รันโมเดลเต็มที่ก็ไม่เกิน 49B, Q4_K_M,
TheDrummer_Valkyrie-49B-v2.1-Q4_K_M.gguf - 30.2 GB + KV Cache (Context Size ไม่เยอะเท่าไร) + Buffer = VRAM หมด
ถ้าอยากได้ Context Size เพิ่มต้องลดไซส์โมเดล 49B, Q4_K_S,
TheDrummer_Valkyrie-49B-v2.1-Q4_K_S.gguf - 28.6 GB, อะไรก็ว่าไป แลกกับ Perplexity Loss ที่เพิ่มขึ้น
เสียเงินซื้อ API เหอะครับ 5555 ถูกกว่าเยอะ ถ้าจะใช้โมเดลทั่วไปอ่ะ, เร็วกว่าด้วยเพราะโมเดลมันอยู่บนเม็ดแรม HBM
ถ้ากังวลเรื่องความเป็นส่วนตัว, อยากรันโมเดลเฉพาะทาง หรือต้องรันโมเดล 24/7 ก็อีกเรื่องครับ
อีกทางเลือกคือเช่า Cloud GPU เหมาะนะสำหรับอารมณ์แบบ อยากลองเล่นโมเดลใหญ่ๆ ถ้าคิดว่าเล่นไม่นานก็คงเลิก