หน้าแรก / บทความ / Hardware
Hardware วิเคราะห์จากสเปค + รีวิว

วิเคราะห์และรีวิว Qwen 3.8 27B บน RTX 5090: VRAM อย่างเดียวไม่พอเมื่อซอฟต์แวร์และเอนจินอินเฟอเรนซ์ยังเป็นคอขวด

เจาะลึกผลทดสอบ Qwen 3.8 27B บน RTX 5090 ทั้งเดี่ยวและคู่การ์ด เทียบ llama.cpp, vLLM และ SGLang ที่ชี้ว่าคอขวดจริงอยู่ที่ซอฟต์แวร์มากกว่าขนาด VRAM

วิเคราะห์และรีวิว Qwen 3.8 27B บน RTX 5090: VRAM อย่างเดียวไม่พอเมื่อซอฟต์แวร์และเอนจินอินเฟอเรนซ์ยังเป็นคอขวด

RTX 5090 มาพร้อม VRAM 32 GB ซึ่งดูเหลือเฟือสำหรับโมเดลขนาด 27B อย่าง Qwen 3.8 27B แต่ผลทดสอบจริงกลับชี้ว่าความจุอย่างเดียวไม่ได้แปลว่าจะได้ความเร็วหรือประสบการณ์ใช้งานที่ลื่นเสมอไป

สิ่งที่กำหนดผลลัพธ์จริงคือ inference engine ที่เลือกใช้ ไม่ว่าจะเป็น llama.cpp, vLLM หรือ SGLang ต่างให้ตัวเลขต่างกันมากแม้รันบนฮาร์ดแวร์ตัวเดียวกัน บทความนี้จะไล่ดูว่าคอขวดจริงอยู่ตรงไหน และทำไม VRAM เยอะถึงไม่การันตีความเร็ว

VRAM 32 GB ของ RTX 5090 ไม่ได้แปลว่าโมเดล 27B จะรันลื่นทันที

RTX 5090 สำหรับรันโมเดลภาษาขนาดใหญ่อย่าง Qwen 3.8 27B

ความคาดหวังทั่วไปคือ การ์ดที่มี VRAM มากพอจะโหลดโมเดลได้สบายและตอบสนองเร็วตามสเปกบนกระดาษ แต่ในทางปฏิบัติ ความเร็วจริงขึ้นกับว่าซอฟต์แวร์จัดการหน่วยความจำ, KV cache และการแบ่งงานระหว่าง GPU ได้ดีแค่ไหนมากกว่า

จุดที่ทำให้ภาพชัดคือการรันโมเดลเดียวกันด้วยเอนจินต่างกันแล้วได้ตัวเลขต่างกันหลายเท่า ทั้งที่ใช้การ์ดตัวเดียวกันทุกอย่าง นี่คือสาเหตุที่การซื้อการ์ดแรงอย่างเดียวไม่พอ ต้องเลือก stack ซอฟต์แวร์ให้ถูกด้วย

ชุดทดสอบจริง: RTX 5090 เดี่ยวและคู่ กับสามอินเฟอเรนซ์เอนจิน

ชุดทดสอบใช้ RTX 5090 ซึ่งมี VRAM 32 GB แบบ GDDR7, บัส 512 บิต, bandwidth ราว 1,792 GB/s, CUDA cores 21,760 ตัว และ Tensor Cores รุ่นที่ 5 จำนวน 680 ตัว ใช้พลังงานสูงสุด 575 W ทดสอบทั้งแบบการ์ดเดียวและสองการ์ดคู่กัน

เอนจินที่นำมาเทียบมีสามตัวคือ llama.cpp, vLLM และ SGLang แต่ละตัวมีจุดแข็งจุดอ่อนต่างกันชัดเจน โดยเฉพาะ vLLM ที่ต้องการทรัพยากรระบบสูงกว่าที่คิด ในการทดสอบต้องเปิด RAM หลัก 64 GB และเพิ่ม swap อีก 64 GB เพื่อให้โหลด Qwen 3.8 27B ขึ้นมาได้สำเร็จ ซึ่งสะท้อนว่าคอขวดไม่ได้อยู่แค่บน GPU เท่านั้น

llama.cpp เปิด context ได้ไกล แต่ต้องแลกกับเวลารอ

กราฟเปรียบเทียบความเร็วของ llama.cpp เมื่อรัน Qwen 3.8 27B บน RTX 5090

llama.cpp เปิดใช้ context window ได้ไกลถึง 208,896 tokens บน RTX 5090 ตัวเดียวด้วยควอนไทซ์ Q6 ส่วนการตั้งค่าให้เต็ม 262,144 tokens กลับล้มเหลวตรง KV cache buffer หลัก ทำให้ต้องยอมตัดบริบทลงในทางปฏิบัติ

ปัญหาที่ชัดกว่านั้นคือเวลาในการประมวลผล prompt ยาว ๆ time-to-first-token ยืดไปได้ถึงราว 30 นาทีเมื่อ context ยาวมาก ส่วนความเร็วตอนสร้างคำตอบ (decode) อยู่ที่ราว 74 tokens ต่อวินาที และขยับขึ้นไปถึงราว 134 tokens ต่อวินาทีเมื่อเปิดใช้ speculative decoding ร่วมกับ draft head ซึ่งต่างจากภาพที่ควรได้จากการ์ดระดับ flagship อยู่มาก

สลับไปใช้ vLLM กับ SGLang ตัวเลขเปลี่ยนไปแค่ไหน

เมื่อเปลี่ยนจาก llama.cpp แบบ stock ไปใช้ vLLM หรือ SGLang ที่ปรับจูนแล้ว ผลต่างด้านความเร็วอยู่ระหว่าง 2 ถึง 8 เท่า ซึ่งมากพอที่จะบอกได้ว่าคอขวดที่แท้จริงอยู่ที่ inference stack ไม่ใช่ตัวฮาร์ดแวร์

บน RTX 5090 สองการ์ดพร้อมกัน vLLM ทำความเร็วได้ราว 70-80 tokens ต่อวินาที และขยับขึ้นไปเป็น 100-110 tokens ต่อวินาทีหลังเปิดใช้ multi-token prediction ส่วน SGLang ที่ตั้งค่าด้วย NVFP4 ร่วมกับ speculative decoding ทำได้มากกว่า 200 tokens ต่อวินาทีบน RTX 5090 เพียงการ์ดเดียว ซึ่งเป็นตัวเลขที่สูงกว่า llama.cpp stock หลายเท่าตัว

เปรียบเทียบการตั้งค่า RTX 5090 การ์ดเดียวและสองการ์ดสำหรับรันโมเดลภาษาขนาดใหญ่
Factor llama.cpp (stock)vLLM (คู่การ์ด + MTP)SGLang (NVFP4 + speculative)
ความเร็ว decode ~74-134 tok/s~100-110 tok/s>200 tok/s
จำนวน GPU ที่ใช้ 1 การ์ด2 การ์ด1 การ์ด
ความต้องการ RAM/Swap ใช้ทรัพยากรน้อยกว่าต้องการ RAM สูง + swap เสริมปานกลาง
ความยาว context ที่รองรับ ถึง ~208,896 tokensขึ้นกับการตั้งค่าขึ้นกับการตั้งค่า
ความซับซ้อนการตั้งค่า ตั้งค่าง่ายสุดซับซ้อน ต้องจูนเพิ่มซับซ้อน ต้องจูนเพิ่ม

ตัวเลขเหล่านี้ตอกย้ำว่าเลือกเอนจินผิดสามารถทำให้การ์ดตัวเดียวกันดูช้าลงหลายเท่าตัว การอัปเกรดฮาร์ดแวร์อย่างเดียวจึงแก้ปัญหาได้ไม่หมด

จุดเด่นและจุดที่ต้องยอมรับ

ข้อดี

  • +RTX 5090 มี VRAM 32 GB และ bandwidth ราว 1,792 GB/s เพียงพอสำหรับรันโมเดลขนาด 27B
  • +เมื่อจูน SGLang หรือ vLLM ให้เหมาะสม ความเร็วเพิ่มขึ้นได้หลายเท่าจากค่าเริ่มต้น

ข้อเสีย

  • −llama.cpp แบบ stock ให้ time-to-first-token ที่ช้ามากเมื่อ context ยาว
  • −vLLM ต้องการ RAM และ swap สูงกว่าที่คาด ทำให้ต้นทุนระบบเพิ่มนอกเหนือจากราคาการ์ด
  • −การตั้งค่าให้ได้ความเร็วสูงสุดต้องอาศัยความรู้เฉพาะทางพอสมควร ไม่ใช่แค่เสียบการ์ดแล้วรันได้เลย

พูดตรงๆ ว่าถ้าไม่ปรับ stack ให้ถูก การมี RTX 5090 ก็ไม่ได้แปลว่าจะได้ความเร็วที่คุ้มกับราคาการ์ดเสมอไปครับ

ต้นทุนจริงไม่ได้จบที่ราคาการ์ดจอ

ราคา RTX 5090 เริ่มต้นราว 1,999 ดอลลาร์สหรัฐต่อการ์ด แต่สำหรับการรัน Qwen 3.8 27B ให้ได้ความเร็วระดับที่ใช้งานจริงได้ ต้นทุนไม่ได้จบแค่นั้น เพราะ vLLM ต้องการ RAM หลักเพิ่มและพื้นที่ swap อีกจำนวนมาก และการตั้งค่าให้เอนจินทำงานเต็มประสิทธิภาพยังกินเวลาในการทดลองพอสมควร

ถ้าต้องการความเร็วสูงสุดแบบที่ SGLang ทำได้ อาจต้องเสียเวลาศึกษาและปรับแต่งค่าเช่น NVFP4 กับ speculative decoding เพิ่มเติม ซึ่งเป็นต้นทุนด้านเวลาและความรู้ที่มองข้ามได้ง่ายเมื่อดูแค่ราคาการ์ด

เหมาะกับใคร และใครควรมองข้าม

✓

เหมาะกับ

  • นักพัฒนาที่พร้อมจูน inference engine เองเพื่อดึงประสิทธิภาพสูงสุด
  • ทีมที่ต้องการรันโมเดลขนาดกลางถึงใหญ่บนเครื่องของตัวเองแบบควบคุมข้อมูลได้เต็มที่
  • ผู้ที่มีเครื่องรองรับ RAM และ swap เพียงพอสำหรับ vLLM
!

ลองชั่งน้ำหนักดู

  • ผู้ใช้ที่รับได้กับการลองผิดลองถูกเพื่อหาค่าตั้งต้นที่เหมาะกับงานของตัวเอง
×

ข้ามได้เลย

  • ผู้ที่ต้องการเสียบการ์ดแล้วได้ความเร็วสูงสุดทันทีโดยไม่ต้องปรับตั้งค่าอะไรเพิ่ม

สรุป: ก่อนเพิ่ม VRAM ให้เช็กซอฟต์แวร์ก่อน

ผลทดสอบ Qwen 3.8 27B บน RTX 5090 ชี้ชัดว่าตัวแปรที่ทำให้ความเร็วต่างกันหลายเท่าไม่ใช่ VRAM แต่คือการเลือก inference engine และการตั้งค่าที่เหมาะสม ก่อนตัดสินใจอัปเกรดฮาร์ดแวร์ จึงควรตรวจสอบก่อนว่าเอนจินที่ใช้อยู่รองรับโมเดลและ context ที่ต้องการได้ดีแค่ไหน เพราะบางครั้งการเปลี่ยนซอฟต์แวร์ให้ถูกอาจคุ้มค่ากว่าการซื้อการ์ดเพิ่ม

MSI GeForce RTX 5090 GAMING TRIO OC 32G GDDR7 : G5090-32GTC

🛒 ดูราคาที่ Shopee

หมายเหตุ: บทความนี้มีลิงก์ร่วมร้านค้า (affiliate)