Course 0 · บทที่ 05/10 · Interactive guide
AI เรียนจากตัวอย่างยังไง
คำว่า “เรียนรู้” ใน AI หมายถึงการปรับค่าของแบบจำลองจากข้อมูลหรือ feedback ไม่ใช่การคิดและเข้าใจแบบคน
- บทเรียน
- 05 / 10
- เวลา
- ประมาณ 9 นาที
- ระดับ
- เริ่มต้น · 0/5
- วิชาก่อนหน้า
- AI, ML, Deep Learning และ Generative AI
ไม่ต้องเริ่มด้วยสมการ
“เรียนรู้” คือปรับให้พลาดน้อยลงในงานที่กำหนด
ลองนึกถึงการ ฝึกโยนลูกบอลลงตะกร้า เราโยน ดูว่าลูกตกตรงไหน แล้วปรับแรงหรือมุมก่อนลองใหม่ แบบจำลองก็มีวงจรคล้ายกัน: รับตัวอย่าง ลองให้ผลลัพธ์ รับข้อมูลว่าผลเป็นอย่างไร แล้วปรับค่าภายใน
กดเปลี่ยน feedback
งานเดิม แต่ข้อมูลตอบกลับต่างกัน จะเรียนแบบไหน?
สมมติว่าเรากำลังฝึกระบบจัดการภาพผลไม้ เลือกสิ่งที่ระบบได้รับหลังลองทำงานหนึ่งครั้ง แล้วดูว่าโหมดการเรียนและก้าวถัดไปเปลี่ยนอย่างไร
- ระบบได้รับ
- ภาพพร้อม label ที่เป็นคำตอบถูก
- ระบบเปรียบเทียบ
- คำทำนาย “ส้ม” กับ label จริง “แอปเปิล” เพื่อคำนวณ error
- ก้าวถัดไป
- ปรับค่าของแบบจำลองเพื่อลด error แล้วลองกับตัวอย่างที่มี label ชุดต่อไป
- ข้อจำกัด
- ต้องมีคนหรือกระบวนการสร้าง label ที่ถูกต้องและครอบคลุม
วงจรฝึกจริง
ระบบไม่ได้รับคำตอบของทุกกรณีในอนาคต
- 1
รับชุดฝึก
ตัวอย่างอาจมี label ไม่มี label หรือมาพร้อมสัญญาณรางวัล ขึ้นกับวิธีเรียน
- 2
ให้ผลลัพธ์ด้วยค่าปัจจุบัน
แบบจำลองคำนวณการคาดการณ์ กลุ่ม หรือการกระทำจากค่าที่มีอยู่ตอนนั้น
- 3
วัด error หรือ feedback
บางงานเทียบกับเฉลย บางงานวัดความคล้าย หรือรับรางวัลจากผลของการกระทำ
- 4
ปรับแล้วทำซ้ำ
วิธีฝึกเปลี่ยนค่าทีละน้อยและวนหลายรอบ จากนั้นต้องประเมินกับข้อมูลที่ไม่ได้ใช้ปรับค่า
ศัพท์ที่ควรรู้
สามวิธีเรียนต่างกันที่สัญญาณที่ได้รับ
Supervised
เรียนแบบมีตัวอย่างพร้อมคำตอบ
ตัวอย่างจริง: อีเมลที่ถูกติด label “สแปม/ไม่ใช่สแปม” ใช้ฝึกตัวจำแนก หรือภาพใบไม้พร้อมชื่อโรคใช้ฝึกโมเดลช่วยคัดกรอง
แลกกับ: label อาจแพง ผิด หรือไม่ครอบคลุมกรณีใหม่
Unsupervised
หาโครงสร้างโดยไม่มีเฉลยกำกับ
ตัวอย่างจริง: จัดกลุ่มพฤติกรรมการซื้อที่คล้ายกันเพื่อสำรวจรูปแบบ หรือหาจุดข้อมูลที่ต่างจากกลุ่มอย่างชัดเจนเพื่อให้คนตรวจต่อ
แลกกับ: กลุ่มทางคณิตศาสตร์อาจไม่ตรงกับความหมายที่คนต้องการ
Reinforcement
เรียนจากรางวัลหลังเลือกการกระทำ
ตัวอย่างจริง: ตัวควบคุมในแบบจำลองทดลองเลือกการกระทำ แล้วสะสมรางวัลจากการถึงเป้าหมายโดยไม่ชนสิ่งกีดขวาง
แลกกับ: รางวัลที่ออกแบบไม่ดีอาจผลักให้ระบบหาทางลัด และการลองผิดลองถูกในโลกจริงอาจไม่ปลอดภัย
จำ 3 ข้อ
มองหา feedback ก่อนถามว่า AI เรียนอย่างไร
วงจรพื้นฐานคือ ตัวอย่าง → ผลลัพธ์ → feedback → ปรับค่า แล้วจึงวนซ้ำ
มีเฉลย ไม่มีเฉลย และมีรางวัล นำไปสู่วิธีเรียนและวิธีประเมินที่ต่างกัน
การฝึกไม่ได้รับประกันว่าใช้กับโลกใหม่ได้ดี ต้องทดสอบนอกชุดฝึกและเฝ้าดูหลังนำไปใช้
ทบทวน 3 ข้อ