หน้าแรก / บทความ / AI & LLM
AI & LLM วิเคราะห์จากสเปค + รีวิว

วิเคราะห์และรีวิว: ผู้บริหาร Microsoft ชี้ AI scraping คือการขโมยแรงงานครั้งใหญ่ที่สุดในประวัติศาสตร์มนุษย์

วิเคราะห์ประเด็น AI scraping ผลกระทบต่อแรงงานและวงการเทคโนโลยี พร้อมรีวิวมุมมองของผู้บริหาร Microsoft อย่างรอบด้าน

วิเคราะห์และรีวิว: ผู้บริหาร Microsoft ชี้ AI scraping คือการขโมยแรงงานครั้งใหญ่ที่สุดในประวัติศาสตร์มนุษย์

คำสารภาพนี้ไม่ได้มาจากแถลงการณ์อย่างเป็นทางการ แต่มาจากเอกสารภายในที่ Microsoft ไม่เคยตั้งใจให้ใครเห็น ในบันทึกที่เขียนขึ้นเมื่อเดือนมกราคม 2023 Brent Hecht ผู้ดำรงตำแหน่ง Director of Applied Science ของ Microsoft บรรยายการขูดข้อมูลเพื่อฝึก AI ว่าเป็น “astonishing theft of unprecedented proportions” และเรียกมันตรงๆ ว่า “the largest theft of labor in human history” หรือ “การขโมยแรงงานครั้งใหญ่ที่สุดในประวัติศาสตร์มนุษย์” ข้อความเหล่านี้เพิ่งถูกเปิดเผยต่อสาธารณะในเดือนกันยายน 2026 ผ่านเอกสารศาลที่ไม่ปิดผนึกแล้วในคดีที่ The New York Times ฟ้อง Microsoft และ OpenAI ฐานละเมิดลิขสิทธิ์

จุดเริ่มต้น: บันทึกภายในที่ไม่ได้ตั้งใจให้ใครเห็น

Hecht ไม่ได้เขียนบันทึกนี้เพื่อวิจารณ์คู่แข่ง แต่เขียนขึ้นภายในทีมวิจัยของ Microsoft เอง เพื่อเตือนถึงสิ่งที่เขาเรียกว่า “doom loop” เมื่อ AI ตอบคำถามแทนการพาผู้ใช้ไปอ่านต้นฉบับ สำนักพิมพ์จะเสียทั้งยอดเข้าชมและรายได้โฆษณา เมื่อรายได้หด แรงจูงใจในการผลิตเนื้อหาคุณภาพก็ลดลงตาม และสุดท้าย AI รุ่นถัดไปก็จะมีข้อมูลใหม่ให้เรียนรู้น้อยลงไปด้วย นี่คือวงจรที่ Hecht มองว่าจะกัดกร่อนอุตสาหกรรมข่าวจากด้านใน ไม่ใช่แค่เรื่องจริยธรรมที่ถกเถียงกันลอยๆ

ภาพประกอบล้อเลียนหุ่นยนต์ AI ขโมยเงินออกจากตู้เซฟ พร้อมข้อความ AI is a Thief
กรอบคิดเรื่อง AI scraping เท่ากับการขโมย ที่ปรากฏอยู่ในเอกสารภายในของ Microsoft เอง

ตัวเลขที่อยู่เบื้องหลังคำเตือนของ Hecht

คำเตือนของ Hecht ไม่ได้ลอยอยู่บนอากาศ เพราะเอกสารในคดีเดียวกันเผยตัวเลขวิจัยภายในของ Microsoft เองว่า Copilot ทำให้อัตราการคลิกกลับไปอ่านบทความต้นฉบับของ NYT ลดลงมากถึง 93% เมื่อเทียบกับการค้นหาผ่าน Bing แบบเดิม

ฝั่งชุดข้อมูลฝึกโมเดลก็มีตัวเลขที่ชัดเจนไม่แพ้กัน ชุดข้อมูล mid-training ของ OpenAI มีสำเนาผลงานจาก NYT, Daily News และ Center for Investigative Reporting รวมกันกว่า 91,692 ชิ้น ชุดข้อมูลที่มาจาก Common Crawl มีเอกสารจากโดเมน nytimes.com เพียงเว็บเดียวมากกว่า 2 ล้านฉบับ ส่วนชุดข้อมูล Project Mango มีผลงานที่ไม่ซ้ำกันจากสำนักข่าวต่างๆ อย่างน้อย 160,903 ชิ้น ตัวเลขเหล่านี้บอกขนาดของปัญหาได้ชัดกว่าคำพูดใดๆ

ภาพประกอบหุ่นยนต์ AI ตราชั่งความยุติธรรม และโจรสวมฮู้ดกวาดเก็บข้อมูลใส่ถังพร้อมเงินกองสูง
สัญลักษณ์ของความขัดแย้งระหว่างการพัฒนา AI กับสิทธิของเจ้าของเนื้อหา

เมื่อ OpenAI เรียกสำนักพิมพ์ว่าเผชิญภัยคุกคามต่อการดำรงอยู่

เอกสารชุดเดียวกันยังเปิดเผยคำพูดของ Nick Turley หัวหน้าฝ่าย ChatGPT ของ OpenAI ที่ระบุว่าสำนักพิมพ์กำลังเผชิญ “existential threat” จากผลิตภัณฑ์ของ ChatGPT เขาอธิบายว่าโมเดลเหล่านี้ “largely substitutive” ต่อเนื้อหาต้นฉบับอยู่แล้ว และจะยิ่งทดแทนได้มากขึ้นเมื่อโมเดลเก่งขึ้น

คำพูดนี้ต่างจากท่าทีที่ OpenAI สื่อสารต่อสาธารณะอย่างสิ้นเชิง เพราะในเวทีสาธารณะบริษัทมักพูดถึง AI ว่าเป็นเครื่องมือเสริมที่ช่วยขยายการเข้าถึงข้อมูล ไม่ใช่สิ่งที่จะมาแทนที่สำนักพิมพ์ การที่คำสารภาพภายในขัดกับคำแถลงภายนอกขนาดนี้ คือสิ่งที่ทำให้เอกสารชุดนี้กลายเป็นหลักฐานสำคัญในคดี

หุ่นยนต์สวมหูฟังกำลังอ่านหนังสือปกสีเหลือง สื่อถึง AI ที่เรียนรู้จากเนื้อหาแทนที่จะพาผู้อ่านไปหาต้นฉบับ
เมื่อ AI อ่านและตอบแทนผู้ใช้ ต้นทางของเนื้อหาก็เสียทั้งยอดเข้าชมและรายได้

คดี New York Times กับสิ่งที่เอกสารที่เพิ่งเปิดเผยบอกเรา

The New York Times ยื่นฟ้อง OpenAI และ Microsoft ตั้งแต่ปลายปี 2023 ในข้อหาละเมิดลิขสิทธิ์จากการนำบทความไปฝึกโมเดลโดยไม่ได้รับอนุญาต ตลอดสามปีที่ผ่านมาทั้งสองบริษัทยืนยันจุดยืนว่าการฝึกโมเดลด้วยข้อมูลสาธารณะเข้าข่าย fair use แต่เอกสารที่เพิ่งไม่ปิดผนึกในเดือนกันยายน 2026 กลับแสดงให้เห็นว่าพนักงานระดับสูงของทั้งสองบริษัทเข้าใจถึงความเสียหายที่เกิดกับสำนักพิมพ์มาตั้งแต่ต้น เพียงแต่ไม่เคยพูดออกมาต่อสาธารณะ

ความต่างระหว่างสิ่งที่พูดในห้องประชุมกับสิ่งที่พูดต่อสื่อ คือประเด็นที่ทำให้คดีนี้มีน้ำหนักมากขึ้น เพราะมันเปลี่ยนจากคำถามว่า AI ฝึกจากข้อมูลลิขสิทธิ์ได้หรือไม่ ไปเป็นคำถามว่าบริษัทที่ทำแบบนั้นรู้ตัวอยู่แล้วหรือเปล่าว่ากำลังทำร้ายใคร

การเก็บข้อมูลแบบเดิมกับการขูดข้อมูลเพื่อฝึกโมเดล AI

การรวบรวมข้อมูลบนเว็บในอดีต เช่น การทำดัชนีของเสิร์ชเอนจิน มีเป้าหมายเพื่อพาผู้ใช้ไปหาต้นฉบับ แต่การขูดข้อมูลเพื่อฝึกโมเดลนำเนื้อหาไปสร้างคำตอบใหม่ที่แทนที่ต้นฉบับได้เลย ความแตกต่างนี้เองที่ทำให้กรณีของ Microsoft และ OpenAI ต่างจากการทำดัชนีค้นหาทั่วไป

Factor การเก็บข้อมูลแบบเดิม (search index)การขูดข้อมูลเพื่อฝึกโมเดล AI
เป้าหมาย พาผู้ใช้ไปอ่านต้นฉบับสร้างคำตอบที่แทนที่ต้นฉบับ
ผลต่อยอดเข้าชม ส่งทราฟฟิกกลับเว็บต้นทางลดทราฟฟิกกลับเว็บต้นทางถึง 93% ในกรณี NYT-Copilot
ความโปร่งใส ตรวจสอบได้ผ่าน robots.txt และ logไม่ชัดเจนว่าเนื้อหาชิ้นไหนถูกใช้ฝึกโมเดลบ้าง
การรับรู้ของเจ้าของเนื้อหา ส่วนใหญ่ยอมรับเพื่อแลกกับทราฟฟิกหลายรายไม่เคยอนุญาตหรือรับรู้ล่วงหน้า

ใครได้ประโยชน์ และใครแบกต้นทุนที่มองไม่เห็น

Microsoft และ OpenAI ได้ข้อมูลปริมาณมหาศาลไปพัฒนาโมเดลให้ฉลาดขึ้นเร็วกว่าคู่แข่ง ผู้ใช้งานทั่วไปก็ได้เครื่องมือที่ตอบคำถามได้ตรงจุดโดยไม่ต้องไล่เปิดหลายเว็บไซต์ แต่ต้นทุนของความสะดวกนี้ไม่ได้กระจายเท่ากัน สำนักพิมพ์และนักเขียนคือฝ่ายที่เสียยอดเข้าชม เสียรายได้โฆษณา และเสียอำนาจต่อรองไปพร้อมกัน

ข้อดี

  • +Microsoft และ OpenAI พัฒนาโมเดลได้เร็วขึ้นจากข้อมูลปริมาณมาก
  • +ผู้ใช้งานได้คำตอบตรงจุดโดยไม่ต้องเปิดหลายเว็บไซต์
  • +งานวิจัยและข้อมูลเชิงลึกเข้าถึงคนกลุ่มใหม่ผ่าน AI ได้ง่ายขึ้น

ข้อเสีย

  • −สำนักพิมพ์เสียทราฟฟิกและรายได้โฆษณาโดยตรง
  • −นักเขียนและครีเอเตอร์ไม่มีช่องทางรับรู้หรือปฏิเสธการนำงานไปฝึกโมเดล
  • −อุตสาหกรรมข่าวเสี่ยงเข้าสู่ doom loop ที่ Hecht เตือนไว้ตั้งแต่ปี 2023

ทางเลือกที่มีอยู่ตอนนี้ นอกจากรอให้บริษัท AI ใจดี

ทางออกที่เป็นรูปธรรมมีอยู่แล้วในตลาด ไม่ใช่แค่ความหวังลอยๆ ตั้งแต่การทำสัญญาอนุญาตใช้ข้อมูลแบบจ่ายค่าตอบแทน ไปจนถึงมาตรฐานทางเทคนิคที่ให้เจ้าของเว็บปิดกั้นบอตฝึกโมเดลได้ และสุดท้ายคือการฟ้องร้องแบบที่ NYT กำลังทำอยู่

Factor ทำสัญญาอนุญาตข้อมูลบล็อกบอตฝึกโมเดลด้วยมาตรฐานเทคนิคฟ้องร้องเรียกค่าเสียหาย
ความเร็วในการเห็นผล เร็ว ถ้าทั้งสองฝ่ายยอมเจรจาเร็วที่สุด แต่ต้องมีมาตรฐานร่วมกันช้า อาจใช้เวลาหลายปีในชั้นศาล
ใครได้ประโยชน์ชัดเจน สำนักพิมพ์รายใหญ่ที่มีอำนาจต่อรองเว็บไซต์ทุกขนาดโจทก์ที่ชนะคดีเท่านั้น
ข้อจำกัด รายเล็กอาจไม่มีอำนาจต่อรองบริษัท AI บางรายไม่เคารพมาตรฐานผลคดีไม่แน่นอน และไม่ช่วยผู้ที่ไม่ได้ฟ้อง

แนวทางที่สื่อและครีเอเตอร์เริ่มทำได้เลยตอนนี้

พูดตรงๆ ว่าการรอให้บริษัท AI ออกกติกาเองคงไม่ทันการณ์ สื่อและครีเอเตอร์ที่ไม่อยากรอคำตัดสินของศาลอย่างเดียว ควรเริ่มจากตรวจสอบว่าเว็บไซต์ของตัวเองบล็อกบอตฝึกโมเดลที่ไม่พึงประสงค์หรือยัง เก็บหลักฐานการเข้าถึงข้อมูลไว้เผื่อใช้ต่อรองหรือฟ้องร้องในอนาคต และร่วมมือกันเป็นกลุ่มเพื่อเพิ่มอำนาจต่อรองกับบริษัท AI รายใหญ่ เพราะรายเดียวมักไม่มีน้ำหนักพอจะเจรจาสัญญาที่เป็นธรรม

กรณีของ Hecht เองก็เป็นตัวอย่างว่าแม้แต่คนในบริษัท AI ก็มองเห็นปัญหานี้มาก่อนที่สาธารณะจะรู้ตั้งหลายปี แต่คำเตือนภายในกลับไม่ถูกแปลงเป็นนโยบายที่เปลี่ยนแปลงอะไรจริงจัง

คำถามที่คดีนี้ยังไม่ตอบ

เอกสารที่เปิดเผยออกมาไม่ได้แค่เปลี่ยนภาพลักษณ์ของ Microsoft และ OpenAI แต่ตั้งคำถามใหม่ให้กับทั้งอุตสาหกรรม ว่าบริษัทที่รู้ตัวว่ากำลังสร้างความเสียหายให้ใคร ควรมีหน้าที่เปิดเผยหรือชดเชยแค่ไหน และใครควรเป็นผู้กำหนดเส้นแบ่งระหว่างการใช้ข้อมูลสาธารณะโดยชอบธรรม กับการขูดแรงงานของคนอื่นไปสร้างมูลค่าให้ตัวเอง คำตัดสินของศาลในคดีนี้อาจกลายเป็นบรรทัดฐานที่กำหนดทิศทางของทั้งวงการในอีกหลายปีข้างหน้า