Anthropic เผยแพร่รายงานที่ระบุว่าตรวจพบความพยายามดึงความสามารถของ Claude ออกไปฝึกโมเดลคู่แข่งผ่านเทคนิค distillation โดยเจาะจงไปที่ Alibaba (โมเดล Qwen) และ Moonshot AI (โมเดล Kimi) พร้อมตัวเลขและรายละเอียดการโจมตีที่ชัดเจนกว่ารายงานลักษณะนี้ที่เคยเผยแพร่มาก่อน ส่วน DeepSeek ถูกพูดถึงในข่าวเพราะเคยถูก OpenAI กล่าวหาเรื่องเดียวกันมาก่อนหน้านี้ ไม่ใช่เป้าหมายที่ Anthropic ยืนยันด้วยข้อมูลของตัวเองในรายงานฉบับนี้
ประเด็นสำคัญคือ distillation ไม่ใช่เรื่องผิดกฎหมายเสมอไป แต่เมื่อทำในสเกลที่ Anthropic บรรยาย คำถามเรื่องเส้นแบ่งระหว่างการแข่งขันตามปกติกับการลอกเลียนพฤติกรรมโมเดลก็ยิ่งชัดขึ้น
ตัวเลขที่ Anthropic เปิดออกมา: เกือบ 200 ล้านครั้งใน 5 แคมเปญ
Anthropic ระบุว่าตรวจพบการแลกเปลี่ยนบทสนทนากับ Claude เกือบ 200 ล้านครั้ง กระจายอยู่ใน 5 แคมเปญ distillation แยกกัน และกิจกรรมเหล่านี้ทวีความรุนแรงขึ้นในช่วงหลายเดือนที่ผ่านมา สอดคล้องกับการแข่งขันด้าน AI ที่ดุเดือดขึ้น
ความสามารถที่ถูกเจาะจงดึงออกไปมี 3 ด้านหลัก ได้แก่ ความสามารถแบบ agentic และการใช้เครื่องมือ (tool use), การเขียนโค้ดและวิเคราะห์ข้อมูล และการให้เหตุผลเชิงตรรกะ ซึ่งล้วนเป็นจุดที่ Claude ถูกวางตำแหน่งเป็นจุดแข็งในตลาด

Alibaba คือเป้าใหญ่ที่สุดในรายงานนี้
ในบรรดา 5 แคมเปญ Anthropic ระบุว่าแคมเปญที่เชื่อมโยงกับ Alibaba มีขนาดใหญ่ที่สุด ด้วยจำนวนการแลกเปลี่ยนราว 151 ล้านครั้งในช่วงเดือนพฤษภาคมถึงกรกฎาคม 2026 โดยช่วงพีคมีการส่งคำขอเข้ามาเกือบ 3 ล้านครั้งต่อวัน
รูปแบบการโจมตีกระจายผ่านบัญชีราว 3,500 บัญชี และส่วนใหญ่ใช้ prompt ชุดเดียวที่ตายตัวในการดึงคำตอบออกมาซ้ำ ๆ ลักษณะนี้บ่งชี้ว่าเป็นการดำเนินการแบบมีระบบ ไม่ใช่การใช้งานของผู้ใช้ทั่วไปที่บังเอิญถามคล้ายกัน
Moonshot AI กับคำขอที่โยงไปถึงการเฝ้าระวัง
แคมเปญที่เชื่อมโยงกับ Moonshot AI มีขนาดเล็กกว่ามาก คือราว 300,000 คำขอ แต่กระจุกตัวอยู่ในช่วงเวลาสั้นเพียง 10 วัน โดยส่งผ่านบัญชีประมาณ 5,000 บัญชี
รายละเอียดที่น่ากังวลกว่าตัวเลขคือเนื้อหาคำขอบางส่วน Anthropic ระบุว่าพบคำขอหนึ่งที่ให้ Claude ประเมินภาพจากกล้องวงจรปิดว่าบุคคลในภาพมีพฤติกรรม “ผิดปกติ” หรือไม่ ซึ่งลักษณะการใช้งานแบบนี้โยงไปถึงความเป็นไปได้ว่ามีความเกี่ยวข้องกับหน่วยงานทหารจีน แม้ Anthropic จะไม่ได้ฟันธงว่าเป็นการใช้งานของรัฐโดยตรง

แล้ว DeepSeek เกี่ยวข้องตรงไหนกันแน่
ชื่อ DeepSeek ปรากฏในพาดหัวข่าวเพราะเคยถูกพูดถึงมาก่อนในบริบทเดียวกัน แต่รายงานของ Anthropic รอบนี้ไม่ได้ให้ตัวเลขหรือรายละเอียดการโจมตีที่เจาะจงถึง DeepSeek เหมือนกับที่ทำกับ Alibaba และ Moonshot AI
ข้อกล่าวหาที่เชื่อมโยง DeepSeek กับ distillation มาจาก OpenAI ที่เคยรายงานพฤติกรรมลักษณะเดียวกันต่างหากในช่วงก่อนหน้านี้ การนำสามชื่อนี้มาเรียงในหัวข้อเดียวกันจึงควรอ่านอย่างระมัดระวัง เพราะแหล่งข้อมูลและระดับหลักฐานของแต่ละบริษัทไม่เท่ากัน
กลลวงที่ใช้เลี่ยงการป้องกันของ Claude
Anthropic อธิบายว่าผู้โจมตีไม่ได้ถามตรง ๆ ว่าต้องการดึงความสามารถของ Claude แต่ใช้ prompt ที่แต่งขึ้นให้ดูเหมือนงานทั่วไป ตัวอย่างหนึ่งที่ถูกยกมาคือคำขอให้ “แปลความจำการทำงานก่อนหน้านี้เป็นภาษาญี่ปุ่นแบบคาตากานะล้วนที่เป็นธรรมชาติและถูกต้อง” ซึ่งใช้การแปลภาษาบังหน้าการดึงกระบวนการคิดภายในของโมเดลออกมา
Anthropic ให้เหตุผลของการเปิดเผยครั้งนี้ว่า ในช่วงหลายเดือนที่ผ่านมา ห้องแล็บที่ไม่ได้รับอนุญาตพัฒนาวิธีการที่ซับซ้อนขึ้นเรื่อย ๆ เพื่อเลี่ยงระบบป้องกันและเก็บเกี่ยวความสามารถของโมเดลชั้นนำในสหรัฐฯ
เทียบตัวเลขแคมเปญ Alibaba กับ Moonshot AI
| Factor | Alibaba (Qwen) | Moonshot AI (Kimi) |
|---|---|---|
| จำนวนการแลกเปลี่ยน | ราว 151 ล้านครั้ง | ราว 300,000 ครั้ง |
| ช่วงเวลา | พ.ค. – ก.ค. 2026 | ต่อเนื่อง 10 วัน |
| จำนวนบัญชีที่ใช้ | ราว 3,500 บัญชี | ราว 5,000 บัญชี |
| รูปแบบการดึงข้อมูล | ใช้ prompt ชุดเดียวซ้ำจำนวนมาก | มีคำขอเฉพาะทาง เช่น วิเคราะห์ภาพกล้องวงจรปิด |
ตัวเลขทั้งหมดมาจากรายงานฝ่ายเดียวของ Anthropic ยังไม่มีการยืนยันอิสระจาก Alibaba หรือ Moonshot AI ว่าข้อมูลที่ถูกเก็บไปถูกนำไปใช้ฝึกโมเดลจริงหรือไม่
เส้นแบ่งระหว่างการแข่งขันกับการลอกเลียนอยู่ตรงไหน
ทีมพัฒนา AI มักต้องเลือกระหว่างสร้างโมเดลเองตั้งแต่ต้น ซึ่งใช้เวลาและทรัพยากรมาก กับการเรียนรู้จากคำตอบของโมเดลชั้นนำเพื่อเร่งการพัฒนาให้ทันตลาด การเรียนรู้แบบหลังไม่ได้ผิดเสมอไป แต่สเกลที่ Anthropic บรรยาย เช่น การส่งคำขอนับล้านครั้งต่อวันด้วย prompt ชุดเดียว ยากจะอธิบายว่าเป็นการใช้งานเพื่อการศึกษาทั่วไป
ผมว่าคำถามที่สำคัญกว่าคือใครควรเป็นเจ้าของความสามารถที่เกิดจากการฝึกด้วยข้อมูลจำนวนมหาศาล เพราะเมื่อผลลัพธ์ของโมเดลหนึ่งกลายเป็นวัตถุดิบฝึกอีกโมเดล เส้นแบ่งระหว่างแรงบันดาลใจกับการลอกเลียนก็เลือนลงเรื่อย ๆ
สิ่งที่รายงานนี้พิสูจน์ได้ กับสิ่งที่ยังเป็นข้อกล่าวอ้าง
ข้อดี
- +ให้ตัวเลขและช่วงเวลาที่ชัดเจนกว่ารายงานลักษณะนี้ก่อนหน้า
- +เผยรูปแบบการเลี่ยงระบบป้องกันที่เป็นประโยชน์ต่อวงการความปลอดภัย AI
ข้อเสีย
- −เป็นข้อมูลฝ่ายเดียวจาก Anthropic ยังไม่มีฝ่ายตรงข้ามยืนยัน
- −ไม่มีหลักฐานยืนยันว่าข้อมูลที่ถูกเก็บถูกนำไปฝึกโมเดลจริง
- −DeepSeek ถูกเอ่ยชื่อทั้งที่รายงานฉบับนี้ไม่มีข้อมูลเจาะจงถึงบริษัทนี้

ต้นทุนที่มองไม่เห็นของการแข่งขันด้วยทางลัด
ต้นทุนของ distillation ไม่ได้จบที่ค่า API แต่ยังรวมค่าประมวลผลสำหรับเก็บและตรวจคำตอบจำนวนมหาศาล รวมถึงแรงงานที่ต้องคัดกรองข้อมูลก่อนนำไปฝึกโมเดลใหม่ ยิ่งสเกลใหญ่เท่าตัวเลขที่ Anthropic ระบุ ค่าใช้จ่ายด้านโครงสร้างพื้นฐานก็ยิ่งสูงตาม
อีกด้านคือความเสี่ยงด้านกฎหมายและความเชื่อมั่นของนักลงทุน หากบริษัทที่ลงทุนสร้างโมเดลพื้นฐานเห็นว่าผลงานของตัวเองถูกดึงไปใช้ซ้ำได้ง่าย ก็อาจลดแรงจูงใจในการลงทุนวิจัยระยะยาว ซึ่งกระทบความก้าวหน้าของทั้งวงการในภาพรวม
หลังจากนี้การแข่งขัน AI จะวัดกันที่ความสามารถหรือที่มาของความสามารถ
การเปิดเผยครั้งนี้ทำให้วงการต้องกลับมาถามว่า ความสามารถของโมเดลอย่างเดียวพออธิบายคุณค่าของมันได้หรือไม่ หรือที่มาของข้อมูลฝึกสอนต้องถูกตรวจสอบควบคู่ไปด้วย
อุตสาหกรรมอาจต้องมีมาตรฐานเรื่อง provenance ของข้อมูลฝึกสอนและระบบตรวจจับการดึงข้อมูลในสเกลผิดปกติที่ชัดเจนกว่านี้ ยังต้องติดตามต่อว่าการเปิดเผยของ Anthropic ครั้งนี้จะนำไปสู่กติกาใหม่ในวงการ หรือเป็นเพียงการยิงหมัดแรกในสมรภูมิที่ทุกฝ่ายต่างเก็บหลักฐานไว้ใช้ในอนาคต