Course 0 · บทที่ 03/10 · Interactive guide
ข้อมูลคืออาหารของ AI
โมเดลเรียนรูปแบบจากตัวอย่างที่เราให้ คุณภาพจึงไม่ได้แปลว่าเยอะอย่างเดียว แต่ต้องครอบคลุม สมดุล และมีข้อผิดพลาดน้อยพอสำหรับงานนั้น
- บทเรียน
- 03 / 10
- เวลา
- ประมาณ 8 นาที
- ระดับ
- เริ่มต้น · 0/5
- วิชาก่อนหน้า
- บทที่ 02 · AI ต่างจากโปรแกรมธรรมดายังไง
01 · เริ่มจากกล่องตัวอย่าง
โมเดลเห็นเฉพาะสิ่งที่อยู่ในชุดฝึก
ถ้าต้องการให้ระบบจำแนกป้ายจราจร เราให้ภาพตัวอย่างพร้อมคำตอบที่ถูก แล้วขั้นตอน training จะปรับโมเดลให้แยกรูปแบบที่ช่วยทำนายป้ายในภาพใหม่
ภาพป้ายหลายแบบ
รวมและจัดคำตอบ
ปรับโมเดลจากความผิดพลาด
ลองกับภาพที่ไม่เคยเห็น
อย่าตีความตามชื่อบทตรงเกินไป: ข้อมูลไม่ใช่อาหารจริง และโมเดลไม่ได้ “กิน” หรือ “เข้าใจ” ภาพ คำนี้เป็นเพียงอุปมาให้จำว่าตัวอย่างที่ใช้ฝึกมีผลต่อพฤติกรรมที่ได้
02 · อุปมาและกรณีจริง
อ่านหนังสือสอบไม่ครบ แล้วเจอข้อที่ไม่เคยฝึก
ป้ายจราจร
ขาดกลางคืนและฝน
ถ้าชุดฝึกมีแต่ภาพกลางวันฟ้าใส โมเดลอาจเปราะบางเมื่อแสงสะท้อน ฝน หรือความมืดเปลี่ยนภาพ
ตัวกรองข้อความ
ภาษาและรูปแบบไม่ครอบคลุม
ชุดที่มีข้อความทางการอย่างเดียวอาจรับมือคำย่อ การสะกดต่าง หรือภาษาที่ผู้ใช้จริงส่งมาไม่ได้ดี
ภาพสินค้า
จำนวนกลุ่มไม่สมดุล
ถ้ามีภาพรองเท้ามากกว่ากระเป๋ามาก โมเดลอาจเอนเอียงไปตอบกลุ่มที่เห็นบ่อยกว่า
03 · ทดลองปรับชุดข้อมูล
Coverage, balance และ noise เปลี่ยนความน่าเชื่อถือยังไง
นี่คือแบบจำลองเพื่อเรียนรู้ ไม่ใช่คะแนน accuracy ของโมเดลจริง ใช้ปุ่มลูกศรบนคีย์บอร์ดเลื่อนแต่ละตัวควบคุมได้
โมเดลอาจจำภาพกลางวันของกลุ่มใหญ่ และเรียนจากคำตอบผิด ควรเพิ่มกรณีที่ขาด ตรวจสมดุล และตรวจ label ก่อนฝึก
04 · คำศัพท์และข้อจำกัด
ข้อมูลที่ “เหมาะกับงาน” สำคัญกว่าคำว่าเยอะ
Coverage
ตัวอย่างครอบคลุมสภาพและกลุ่มที่ระบบจะพบจริงหรือไม่ เช่น แสง มุม ภาษา อุปกรณ์ และกรณีหายาก
Label
คำตอบหรือป้ายกำกับที่ใช้ใน supervised learning เช่น “ป้ายหยุด” ถ้า label ผิด โมเดลได้รับสัญญาณฝึกที่ผิด
Noise
ข้อมูลรบกวน ภาพเสีย ข้อความผิด หรือ label ที่ไม่สม่ำเสมอ ซึ่งบดบังรูปแบบที่ต้องการ
Imbalance
บางกลุ่มมีตัวอย่างมากกว่ากลุ่มอื่นมาก จนผลรวมดูดีแต่กลุ่มที่พบน้อยอาจทำงานแย่
ข้อแลกเปลี่ยน: การเก็บและตรวจข้อมูลเพิ่มใช้เวลา เงิน และอาจกระทบความเป็นส่วนตัว ข้อมูลมากขึ้นจึงไม่ใช่คำตอบอัตโนมัติ ต้องนิยามงาน เก็บเท่าที่จำเป็น ตรวจสิทธิ์การใช้ และวัดผลแยกตามสภาพสำคัญ
05 · จำสามเรื่องนี้
ก่อนพูดว่า “เอาข้อมูลเพิ่ม”
- 01
ตัวอย่างกำหนดขอบเขตการฝึก สิ่งที่ขาดหายอาจกลายเป็นจุดเปราะเมื่อใช้งานจริง
- 02
คุณภาพมีหลายมิติ ดู coverage, balance, labels และ noise ไม่ใช่ดูจำนวนอย่างเดียว
- 03
ต้องทดสอบแยกจากชุดฝึก และตรวจกลุ่มหรือสภาพที่สำคัญ ไม่เชื่อคะแนนรวมเพียงค่าเดียว
06 · เช็กความเข้าใจ
สามคำถามพร้อมคำอธิบาย
1. มีภาพป้ายหนึ่งหมื่นภาพ แต่ทุกภาพถ่ายกลางวัน ปัญหาหลักคืออะไร?
ถูก: coverage ไม่ครบ จำนวนมากในสภาพเดียวไม่ได้รับประกันว่าจะใช้ได้เมื่อสภาพจริงเปลี่ยน
2. Label noise หมายถึงอะไร?
ถูก: คำตอบกำกับมีปัญหา โมเดลจึงถูกผลักให้เรียนความสัมพันธ์ที่ผิดหรือสับสน
3. ทำไม “ข้อมูลมากขึ้น” ไม่ใช่คำตอบเสมอ?
ถูก: ความเกี่ยวข้องและคุณภาพสำคัญ ต้องวัดว่าข้อมูลเพิ่มช่วยกรณีที่ระบบจะพบจริง โดยไม่ละเลยต้นทุนและความเป็นส่วนตัว