หน้าแรก / ความรู้ / AI & LLM
AI & LLM

ประเภทของ AI มีอะไรบ้าง

คู่มือดูประเภทของ AI แบบเข้าใจง่าย — แต่ละแบบเก่งงานอะไร ใช้ตรงไหน และเลือกให้เหมาะกับงานยังไง

เรื่องนี้คืออะไรใน 30 วินาที

AI model คือระบบที่ถูกฝึกจากตัวอย่างจำนวนมากให้จับแพตเทิร์น แล้วเปลี่ยน input ให้เป็น output คำถามสำคัญจึงไม่ใช่ “โมเดลไหนฉลาดที่สุด?” แต่คือ “งานของเราต้องการผู้เชี่ยวชาญแบบไหน?”

ลองนึกว่า AI model เหมือนทีมงานในสตูดิโอ มีนักเขียนดูแลเรื่องภาษา ช่างภาพดูแลรูป นักแปลดูแลภาษาและเสียง และนักวิเคราะห์ดูแลตัวเลข ทุกคนอาจอยู่บริษัทเดียวกัน แต่คงไม่ส่งสัญญาให้ช่างภาพแปลให้แน่ๆ

คำว่า model เป็นศัพท์เทคนิคของ “ผู้เชี่ยวชาญ” ที่ถูกฝึกมาแล้ว ส่วนคำว่า ประเภทของ model มักบอกว่า มันรับข้อมูลแบบไหน สร้างผลลัพธ์อะไร หรือถูกฝึกมาให้ทำงานประเภทใด

FIELD GUIDE · ประเภทของ AI MODEL

เลือกงานก่อน: โมเดลที่เหมาะมักเป็นผู้เชี่ยวชาญที่ถูกฝึกมาตรงกับงานนั้น

คนที่ควรเรียกก่อนLanguage modelโมเดลนี้ถูกฝึกให้ทำงานกับภาษา จึงเหมาะกับการร่าง สรุป และตอบคำถาม

นี่เป็นภาพประกอบเพื่อเรียนรู้ ไม่ใช่ benchmark ของฮาร์ดแวร์หรือโมเดลจริง ผลลัพธ์จริงยังขึ้นกับโมเดล ข้อมูล คำสั่ง และระบบตรวจสอบ

อุปมาในชีวิตประจำวัน

ลองนึกถึงทีมผู้เชี่ยวชาญ 5 คนในสตูดิโอ:

ผู้เชี่ยวชาญประเภท AI modelงานที่ถนัด
นักเขียนLanguage modelเข้าใจและสร้างข้อความ
ช่างภาพVision modelเข้าใจรูป วิดีโอ หรือหน้ากระดาษที่สแกน
ล่ามSpeech และ audio modelฟัง แปล และสร้างเสียง
นักวิเคราะห์Predictive modelประเมินตัวเลข จัดประเภท หรือจับสิ่งผิดปกติ
อาร์ตไดเรกเตอร์Generative modelสร้างข้อความ รูป เสียง หรือวิดีโอใหม่

บทบาทพวกนี้ซ้อนกันได้ สินค้า AI รุ่นใหม่อาจรวมหลายผู้เชี่ยวชาญไว้ในตัวเดียว เช่น อ่านรูป คุยเป็นข้อความ และพูดคำตอบออกมาได้ การแยกบทบาทยังมีประโยชน์ เพราะช่วยให้เห็นว่าสุดท้ายแล้วระบบต้องเข้าใจอะไรและทำงานอะไร ถ้าอยากดูเรื่องระบบที่รับข้อมูลหลายแบบ อ่าน Multimodal AI ต่อได้

มันทำงานยังไง

1. Language model: นักเขียน

Language model เรียนรู้แพตเทิร์นของภาษา จากข้อความที่รับเข้ามา มันคาดเดาคำถัดไปหรือสร้างคำตอบที่เข้ากับคำสั่ง เปรียบเหมือนนักเขียนที่อ่านหนังสือมาเยอะมาก จนรู้ว่าประโยค คำอธิบาย และรูปแบบต่างๆ มักต่อกันยังไง

ศัพท์เทคนิคคือ language model ขนาดใหญ่ หรือ LLM ทำงานกับชิ้นส่วนข้อความเล็กๆ ที่เรียกว่า token แล้วคำนวณว่าคำต่อแบบไหนมีโอกาสเข้ากันได้มากที่สุด แต่ “ฟังดูเข้าท่า” ไม่ได้แปลว่า “ถูกจริง” เสมอไป จึงอาจตอบผิดแบบมั่นใจได้ อ่าน LLM ทำงานยังไง ถ้าอยากลงรายละเอียด

เหมาะกับ: ร่างงาน เขียนใหม่ สรุป ระดมไอเดีย ช่วยเขียนโค้ด และตอบคำถาม

ต้องระวัง: มันไม่ได้รู้เองว่าข้อมูลไหนอัปเดตหรือตรวจสอบแล้ว เรื่องสำคัญควรใช้คำตอบเป็นร่าง แล้วเช็คต่อ

2. Vision model: ช่างภาพ

Vision model ทำงานกับข้อมูลที่มองเห็น เช่น รูปถ่าย กราฟ วิดีโอ หรือเอกสารที่สแกน ลองนึกถึงช่างภาพที่ดู contact sheet เป็น — มันมองหารูปร่าง วัตถุ ตัวหนังสือ และความสัมพันธ์ในภาพ

เบื้องหลัง รูปภาพจะถูกแปลงเป็นแพตเทิร์นที่เครื่องอ่านได้ แล้วโมเดลเชื่อมแพตเทิร์นเหล่านั้นกับสิ่งที่เคยเรียนมา จึงอาจอ่านใบเสร็จ อธิบายแผนภาพ หรือบอกว่ารูปสองรูปเป็นวัตถุประเภทเดียวกัน

เหมาะกับ: ดึงข้อมูลจากเอกสาร อธิบายกราฟ เช็ค layout และบรรยายรูป

ต้องระวัง: ตัวหนังสือเล็ก มุมแปลก แสงไม่ดี หรือรายละเอียดเล็กๆ ยังทำให้พลาดได้ อย่าใช้ผลจาก vision เป็นด่านตรวจเดียวในเรื่องแพทย์ กฎหมาย หรือความปลอดภัยทางกายภาพ

3. Speech และ audio model: ล่าม

Speech model ทำงานกับเสียง บางตัวเปลี่ยนเสียงพูดเป็นข้อความ บางตัวแปลภาษา และบางตัวสร้างเสียงขึ้นมาใหม่ ลองนึกถึงล่ามที่มีเครื่องอัดเสียง: ฟังก่อน แล้วค่อยจดหรือพูดสิ่งที่เข้าใจ

งานที่มักแยกกันคือ speech recognition (เสียง → ข้อความ), text-to-speech (ข้อความ → เสียงพูด) และ audio generation (สร้างเสียงหรือดนตรีใหม่) สินค้าหนึ่งตัวอาจต่อหลายขั้นเข้าด้วยกันจนเรารู้สึกว่าแค่พูดถามแล้วได้คำตอบกลับมา

เหมาะกับ: คำบรรยาย ถอดประชุม ผู้ช่วยเสียง งาน accessibility และฝึกภาษา

ต้องระวัง: สำเนียง เสียงรบกวน คนพูดทับกัน และข้อมูลเสียงที่อ่อนไหว อาจทำให้ผลผิดหรือสร้างความเสี่ยงด้านความเป็นส่วนตัว

4. Predictive model: นักวิเคราะห์

Predictive model ใช้ตัวอย่างในอดีตเพื่อประเมินหมวดหมู่หรือตัวเลข ลองนึกถึงนักวิเคราะห์ที่ดูยอดขายหลายปีแล้วบอกว่า “แพตเทิร์นนี้มักมาก่อนสัปดาห์ที่ลูกค้าแน่น” มันไม่จำเป็นต้องเล่าเรื่องเก่ง แต่ต้องตัดสินใจจากสัญญาณที่เกี่ยวข้องให้สม่ำเสมอ

งานที่พบบ่อยคือ classification (ข้อมูลนี้อยู่กลุ่มไหน?), regression (ควรได้ตัวเลขประมาณเท่าไร?), forecasting, recommendation และ anomaly detection (อะไรดูแปลกจากปกติ?) โมเดลกลุ่มนี้อาจเล็กและเฉพาะทาง ไม่ได้คุยเก่งแบบ chatbot

เหมาะกับ: จับธุรกรรมทุจริต พยากรณ์ความต้องการ กรองสแปม แนะนำสินค้า และเตือนเครื่องจักร

ต้องระวัง: ผลทำนายสะท้อนตัวอย่างและ label ที่ใช้ฝึก ถ้าข้อมูลในอดีตไม่ครบหรือมีอคติ ตัวเลขที่ดูเรียบร้อยก็อาจนำไปสู่การตัดสินใจที่แย่ได้ อ่าน AI กับ bias ต่อได้

5. Generative model: อาร์ตไดเรกเตอร์

Generative model สร้าง output ใหม่ที่มีแพตเทิร์นคล้ายสิ่งที่เห็นตอนฝึก ลองนึกถึงอาร์ตไดเรกเตอร์ที่ได้ brief แล้วทำสเก็ตช์ใหม่ในสไตล์ที่คุ้นเคย

Generative model สร้างได้ทั้งข้อความ รูป เสียง วิดีโอ และโค้ด LLM เองก็เป็น generative model ประเภทหนึ่ง แต่ generative model ไม่ได้เป็น language model ทุกตัว เพราะตัวสร้างรูปเรียนรู้แพตเทิร์นของภาพ ไม่ใช่เฉพาะแพตเทิร์นของคำ

เหมาะกับ: ร่างแรก คอนเซ็ปต์ภาพ ทำหลายเวอร์ชัน สร้างตัวอย่างจำลอง และสำรวจไอเดีย

ต้องระวัง: “สร้างใหม่” ไม่ได้แปลว่า “ต้นฉบับ” “ถูกต้อง” หรือไม่มีความคล้ายที่ไม่ต้องการ ตรวจข้อเท็จจริง ลิขสิทธิ์ คุณภาพ และ consent ให้เหมาะกับงาน

ลองเล่น: เรียกผู้เชี่ยวชาญให้ตรงงาน

ผู้เรียนกำลังปรับ ตัวเลือกประเภทงาน เพื่อค้นพบว่า การเลือกโมเดลควรเริ่มจาก input และ output ที่ต้องการ ไม่ใช่การจัดอันดับว่าใครฉลาดกว่าใคร ลองเปลี่ยนตัวเลือกด้านบน แล้วดูว่าผู้เชี่ยวชาญที่แนะนำเปลี่ยนไปยังไง

ถ้างานหนึ่งรวมหลายโหมด เช่น “อ่านใบเสร็จที่ถ่ายรูปแล้วใส่ยอดรวมลงตาราง” อาจต้องต่อผู้เชี่ยวชาญหลายตัวเข้าด้วยกัน หรือใช้ระบบ multimodal ตัวเดียว ลองถามให้ชัดว่าแต่ละขั้นต้องเข้าใจอะไร และมีจุดไหนพลาดได้บ้าง

ใช้ที่ไหนในโลกจริง

  • ในมือถือ: speech recognition สำหรับพิมพ์ด้วยเสียง vision สำหรับค้นหาจากกล้อง และ generative model สำหรับแต่งรูป
  • ในที่ทำงาน: language model ร่างอีเมล predictive model พยากรณ์ยอดขาย และ vision model ดึงข้อมูลจากฟอร์ม
  • ในเครื่องมือสร้างสรรค์: generative model ของรูป เสียง และวิดีโอทำตัวเลือกหลายแบบให้คนเลือกและเกลา
  • เบื้องหลัง search และ recommendation: predictive และ ranking model ประเมินว่าผลลัพธ์หรือสินค้าชิ้นไหนน่าจะมีประโยชน์ที่สุด

ชื่อสินค้าอาจซ่อนทีมนี้ไว้ “AI assistant” อาจหมายถึง language model ที่มี vision และ speech ล้อมรอบ คำถามที่มีประโยชน์กว่าคือ อะไรถูกส่งเข้าไป อะไรถูกส่งออกมา และใครเป็นคนเช็คผลลัพธ์?

สิ่งที่คนมักเข้าใจผิด

ความเข้าใจผิด: “โมเดลที่ใหญ่กว่าหรือใหม่กว่าย่อมดีที่สุดกับทุกงาน”
ไม่เสมอไป โมเดลใหญ่แบบ general อาจทำได้หลายอย่าง แต่โมเดลเล็กที่เฉพาะทางอาจเร็วกว่า ถูกกว่า รันแบบเป็นส่วนตัวง่ายกว่า หรือสม่ำเสมอกว่า คำว่า “ดีที่สุด” ต้องดูทั้งความแม่น ความเร็ว ค่าใช้จ่าย ความเป็นส่วนตัว และความเสียหายถ้าพลาด

Optional branch: อีก 2 คำที่อาจได้ยิน

คำสองคำนี้พูดถึงอีกชั้นของทีมเดียวกัน:

  • Foundation model: โมเดลฐานที่ฝึกมาค่อนข้างกว้างและนำไปปรับกับงานได้หลายแบบ เหมือนคนเก่งรอบด้านก่อนเข้าสังกัดแผนก
  • Fine-tuned model: โมเดลฐานที่ฝึกต่อด้วยตัวอย่างเฉพาะทาง เหมือนส่งคนเก่งรอบด้านไปเรียนหลักสูตรของแผนกนั้นโดยตรง Fine-tuning กับ Prompting อธิบายความต่างกับการสั่งงานให้ละเอียดขึ้น

สองคำนี้มีประโยชน์ แต่ยังไม่ต้องเข้าใจรายละเอียดการฝึกโมเดลก็เลือก AI สำหรับงานแรกในชีวิตประจำวันได้

จำแค่นี้

  • ประเภทของโมเดลเป็นเบาะแสว่าสร้างมาให้ทำงานกับอะไร: ภาษา รูป เสียง การพยากรณ์ หรือการสร้างสิ่งใหม่
  • สินค้าสมัยใหม่รวมผู้เชี่ยวชาญหลายแบบได้ ให้ดูว่า input, output และจุดส่งต่องานคืออะไร
  • เลือกจากงานและข้อแลกเปลี่ยน ไม่ใช่เลือกจากชื่อที่ใหญ่ที่สุดหรือจำนวน parameter ที่เยอะที่สุด

Quiz 3 ข้อ

1. อยากสรุปรายงานยาวๆ ควรเรียกผู้เชี่ยวชาญคนไหนก่อน?

เฉลยพร้อมเหตุผล

Language model ถูกฝึกมาให้ทำงานกับคำ ถ้ารายงานเป็นรูปสแกนจริงๆ อาจต้องใช้ vision เพื่ออ่านก่อน

2. คำว่า “โมเดลที่ดีที่สุด” ขึ้นกับอะไรจริงๆ?

เฉลยพร้อมเหตุผล

โมเดลเฉพาะทางที่เล็กกว่าอาจเหมาะกว่าเมื่อความเร็ว ความเป็นส่วนตัว ค่าใช้จ่าย หรือความสม่ำเสมอสำคัญ

3. ระบบอ่านรูป ตอบเป็นข้อความ และพูดออกเสียงได้ น่าจะหมายความว่าอะไร?

เฉลยพร้อมเหตุผล

การอ่านภาพ สร้างข้อความ และสร้างเสียงเป็นคนละงานกัน แม้ในสินค้าตัวเดียวจะทำให้รู้สึกต่อเนื่อง

ไปต่อบทไหน

ถ้าอยากเห็นแผนผังครอบครัว AI เริ่มจาก AI คืออะไร ถ้าอยากเลือกเครื่องมือให้เหมาะกับงาน อ่าน เลือกใช้ AI ตัวไหนดี ต่อได้ ส่วนแขนงเสริมสำหรับงานหลายขั้นตอนคือ reasoning model ซึ่งเป็น language model ที่ถูกปรับให้รับมือโจทย์ซับซ้อนขึ้น