Course 0 · บทที่ 05/10 · Interactive guide

AI เรียนจากตัวอย่างยังไง

คำว่า “เรียนรู้” ใน AI หมายถึงการปรับค่าของแบบจำลองจากข้อมูลหรือ feedback ไม่ใช่การคิดและเข้าใจแบบคน

บทเรียน
05 / 10
เวลา
ประมาณ 9 นาที
ระดับ
เริ่มต้น · 0/5
วิชาก่อนหน้า
AI, ML, Deep Learning และ Generative AI

ไม่ต้องเริ่มด้วยสมการ

“เรียนรู้” คือปรับให้พลาดน้อยลงในงานที่กำหนด

ลองนึกถึงการ ฝึกโยนลูกบอลลงตะกร้า เราโยน ดูว่าลูกตกตรงไหน แล้วปรับแรงหรือมุมก่อนลองใหม่ แบบจำลองก็มีวงจรคล้ายกัน: รับตัวอย่าง ลองให้ผลลัพธ์ รับข้อมูลว่าผลเป็นอย่างไร แล้วปรับค่าภายใน

ตัวอย่างคาดการณ์ข้อผิดพลาด / feedbackปรับค่า

กดเปลี่ยน feedback

งานเดิม แต่ข้อมูลตอบกลับต่างกัน จะเรียนแบบไหน?

สมมติว่าเรากำลังฝึกระบบจัดการภาพผลไม้ เลือกสิ่งที่ระบบได้รับหลังลองทำงานหนึ่งครั้ง แล้วดูว่าโหมดการเรียนและก้าวถัดไปเปลี่ยนอย่างไร

โหมดที่เข้ากัน

Supervised Learning

ระบบได้รับ
ภาพพร้อม label ที่เป็นคำตอบถูก
ระบบเปรียบเทียบ
คำทำนาย “ส้ม” กับ label จริง “แอปเปิล” เพื่อคำนวณ error
ก้าวถัดไป
ปรับค่าของแบบจำลองเพื่อลด error แล้วลองกับตัวอย่างที่มี label ชุดต่อไป
ข้อจำกัด
ต้องมีคนหรือกระบวนการสร้าง label ที่ถูกต้องและครอบคลุม

วงจรฝึกจริง

ระบบไม่ได้รับคำตอบของทุกกรณีในอนาคต

  1. 1

    รับชุดฝึก

    ตัวอย่างอาจมี label ไม่มี label หรือมาพร้อมสัญญาณรางวัล ขึ้นกับวิธีเรียน

  2. 2

    ให้ผลลัพธ์ด้วยค่าปัจจุบัน

    แบบจำลองคำนวณการคาดการณ์ กลุ่ม หรือการกระทำจากค่าที่มีอยู่ตอนนั้น

  3. 3

    วัด error หรือ feedback

    บางงานเทียบกับเฉลย บางงานวัดความคล้าย หรือรับรางวัลจากผลของการกระทำ

  4. 4

    ปรับแล้วทำซ้ำ

    วิธีฝึกเปลี่ยนค่าทีละน้อยและวนหลายรอบ จากนั้นต้องประเมินกับข้อมูลที่ไม่ได้ใช้ปรับค่า

ศัพท์ที่ควรรู้

สามวิธีเรียนต่างกันที่สัญญาณที่ได้รับ

Supervised

เรียนแบบมีตัวอย่างพร้อมคำตอบ

ตัวอย่างจริง: อีเมลที่ถูกติด label “สแปม/ไม่ใช่สแปม” ใช้ฝึกตัวจำแนก หรือภาพใบไม้พร้อมชื่อโรคใช้ฝึกโมเดลช่วยคัดกรอง

แลกกับ: label อาจแพง ผิด หรือไม่ครอบคลุมกรณีใหม่

Unsupervised

หาโครงสร้างโดยไม่มีเฉลยกำกับ

ตัวอย่างจริง: จัดกลุ่มพฤติกรรมการซื้อที่คล้ายกันเพื่อสำรวจรูปแบบ หรือหาจุดข้อมูลที่ต่างจากกลุ่มอย่างชัดเจนเพื่อให้คนตรวจต่อ

แลกกับ: กลุ่มทางคณิตศาสตร์อาจไม่ตรงกับความหมายที่คนต้องการ

Reinforcement

เรียนจากรางวัลหลังเลือกการกระทำ

ตัวอย่างจริง: ตัวควบคุมในแบบจำลองทดลองเลือกการกระทำ แล้วสะสมรางวัลจากการถึงเป้าหมายโดยไม่ชนสิ่งกีดขวาง

แลกกับ: รางวัลที่ออกแบบไม่ดีอาจผลักให้ระบบหาทางลัด และการลองผิดลองถูกในโลกจริงอาจไม่ปลอดภัย

จำ 3 ข้อ

มองหา feedback ก่อนถามว่า AI เรียนอย่างไร

1

วงจรพื้นฐานคือ ตัวอย่าง → ผลลัพธ์ → feedback → ปรับค่า แล้วจึงวนซ้ำ

2

มีเฉลย ไม่มีเฉลย และมีรางวัล นำไปสู่วิธีเรียนและวิธีประเมินที่ต่างกัน

3

การฝึกไม่ได้รับประกันว่าใช้กับโลกใหม่ได้ดี ต้องทดสอบนอกชุดฝึกและเฝ้าดูหลังนำไปใช้

ทบทวน 3 ข้อ

เลือกจากชนิดของ feedback

1. มีภาพแมวและสุนัขพร้อม label ถูกต้องทุกภาพ วิธีใดตรงที่สุด?

เลือกคำตอบเพื่อดูคำอธิบาย

2. ระบบลองการกระทำและได้คะแนนหลังแต่ละครั้ง กำลังใช้สัญญาณแบบใด?

เลือกคำตอบเพื่อดูคำอธิบาย

3. หลัง error ในชุดฝึกลดลงมาก ควรทำอะไรต่อ?

เลือกคำตอบเพื่อดูคำอธิบาย