Course 0 · บทที่ 03/10 · Interactive guide

ข้อมูลคืออาหารของ AI

โมเดลเรียนรูปแบบจากตัวอย่างที่เราให้ คุณภาพจึงไม่ได้แปลว่าเยอะอย่างเดียว แต่ต้องครอบคลุม สมดุล และมีข้อผิดพลาดน้อยพอสำหรับงานนั้น

บทเรียน
03 / 10
เวลา
ประมาณ 8 นาที
ระดับ
เริ่มต้น · 0/5
วิชาก่อนหน้า
บทที่ 02 · AI ต่างจากโปรแกรมธรรมดายังไง

01 · เริ่มจากกล่องตัวอย่าง

โมเดลเห็นเฉพาะสิ่งที่อยู่ในชุดฝึก

ถ้าต้องการให้ระบบจำแนกป้ายจราจร เราให้ภาพตัวอย่างพร้อมคำตอบที่ถูก แล้วขั้นตอน training จะปรับโมเดลให้แยกรูปแบบที่ช่วยทำนายป้ายในภาพใหม่

01Examples

ภาพป้ายหลายแบบ

02Dataset

รวมและจัดคำตอบ

03Training

ปรับโมเดลจากความผิดพลาด

04Prediction

ลองกับภาพที่ไม่เคยเห็น

อย่าตีความตามชื่อบทตรงเกินไป: ข้อมูลไม่ใช่อาหารจริง และโมเดลไม่ได้ “กิน” หรือ “เข้าใจ” ภาพ คำนี้เป็นเพียงอุปมาให้จำว่าตัวอย่างที่ใช้ฝึกมีผลต่อพฤติกรรมที่ได้

02 · อุปมาและกรณีจริง

อ่านหนังสือสอบไม่ครบ แล้วเจอข้อที่ไม่เคยฝึก

ชุดข้อมูลเหมือนชุดโจทย์ฝึกมีโจทย์หนึ่งพันข้อก็ไม่ได้ช่วยเสมอไป ถ้าทุกข้อเป็นแบบเดียวกัน เฉลยผิด หรือไม่มีหัวข้อที่จะเจอในข้อสอบจริง ชุดเล็กที่ครอบคลุมและตรวจคำตอบดีอาจมีประโยชน์กว่า

ป้ายจราจร

ขาดกลางคืนและฝน

ถ้าชุดฝึกมีแต่ภาพกลางวันฟ้าใส โมเดลอาจเปราะบางเมื่อแสงสะท้อน ฝน หรือความมืดเปลี่ยนภาพ

ตัวกรองข้อความ

ภาษาและรูปแบบไม่ครอบคลุม

ชุดที่มีข้อความทางการอย่างเดียวอาจรับมือคำย่อ การสะกดต่าง หรือภาษาที่ผู้ใช้จริงส่งมาไม่ได้ดี

ภาพสินค้า

จำนวนกลุ่มไม่สมดุล

ถ้ามีภาพรองเท้ามากกว่ากระเป๋ามาก โมเดลอาจเอนเอียงไปตอบกลุ่มที่เห็นบ่อยกว่า

03 · ทดลองปรับชุดข้อมูล

Coverage, balance และ noise เปลี่ยนความน่าเชื่อถือยังไง

นี่คือแบบจำลองเพื่อเรียนรู้ ไม่ใช่คะแนน accuracy ของโมเดลจริง ใช้ปุ่มลูกศรบนคีย์บอร์ดเลื่อนแต่ละตัวควบคุมได้

สัญญาณคุณภาพของชุดทดลองเปราะบาง

โมเดลอาจจำภาพกลางวันของกลุ่มใหญ่ และเรียนจากคำตอบผิด ควรเพิ่มกรณีที่ขาด ตรวจสมดุล และตรวจ label ก่อนฝึก

04 · คำศัพท์และข้อจำกัด

ข้อมูลที่ “เหมาะกับงาน” สำคัญกว่าคำว่าเยอะ

Coverage

ตัวอย่างครอบคลุมสภาพและกลุ่มที่ระบบจะพบจริงหรือไม่ เช่น แสง มุม ภาษา อุปกรณ์ และกรณีหายาก

Label

คำตอบหรือป้ายกำกับที่ใช้ใน supervised learning เช่น “ป้ายหยุด” ถ้า label ผิด โมเดลได้รับสัญญาณฝึกที่ผิด

Noise

ข้อมูลรบกวน ภาพเสีย ข้อความผิด หรือ label ที่ไม่สม่ำเสมอ ซึ่งบดบังรูปแบบที่ต้องการ

Imbalance

บางกลุ่มมีตัวอย่างมากกว่ากลุ่มอื่นมาก จนผลรวมดูดีแต่กลุ่มที่พบน้อยอาจทำงานแย่

ข้อแลกเปลี่ยน: การเก็บและตรวจข้อมูลเพิ่มใช้เวลา เงิน และอาจกระทบความเป็นส่วนตัว ข้อมูลมากขึ้นจึงไม่ใช่คำตอบอัตโนมัติ ต้องนิยามงาน เก็บเท่าที่จำเป็น ตรวจสิทธิ์การใช้ และวัดผลแยกตามสภาพสำคัญ

05 · จำสามเรื่องนี้

ก่อนพูดว่า “เอาข้อมูลเพิ่ม”

  1. 01

    ตัวอย่างกำหนดขอบเขตการฝึก สิ่งที่ขาดหายอาจกลายเป็นจุดเปราะเมื่อใช้งานจริง

  2. 02

    คุณภาพมีหลายมิติ ดู coverage, balance, labels และ noise ไม่ใช่ดูจำนวนอย่างเดียว

  3. 03

    ต้องทดสอบแยกจากชุดฝึก และตรวจกลุ่มหรือสภาพที่สำคัญ ไม่เชื่อคะแนนรวมเพียงค่าเดียว

06 · เช็กความเข้าใจ

สามคำถามพร้อมคำอธิบาย

1. มีภาพป้ายหนึ่งหมื่นภาพ แต่ทุกภาพถ่ายกลางวัน ปัญหาหลักคืออะไร?

2. Label noise หมายถึงอะไร?

3. ทำไม “ข้อมูลมากขึ้น” ไม่ใช่คำตอบเสมอ?