TL;DR: ทีมวิจัยความปลอดภัย Hacktron AI ใช้ Claude ไล่ประกอบช่องโหว่ในไฟล์ภาพ HEIF บนฟอรัม Discourse ของ OpenAI จนแฮ็กบัญชี ChatGPT ของพนักงานหลายคน และต่อยอดไปถึง repository ภายในได้สำเร็จ ทั้งหมดเกิดขึ้นภายใต้โครงการ bug bounty ที่ OpenAI อนุญาตไว้ล่วงหน้า ไม่ใช่การโจมตีที่ผิดกฎหมาย
Hacktron AI สตาร์ทอัพด้านความปลอดภัยไซเบอร์ทีมเล็กเพียง 3 คน นำโดยผู้ก่อตั้ง Mohan Pedhapati ใช้ Claude เป็นผู้ช่วยไล่หาและประกอบช่องโหว่ จนสามารถเข้าควบคุมบัญชี ChatGPT ของพนักงาน OpenAI หลายคน แล้วต่อยอดไปถึงการเข้าถึง repository ภายในองค์กรได้จริง งานทั้งหมดอยู่ภายใต้โครงการ bug bounty ของ OpenAI บน Bugcrowd ซึ่งเป็นการทดสอบที่ได้รับอนุญาตล่วงหน้า ไม่ใช่การเจาะระบบผิดกฎหมายแต่อย่างใด
เหตุการณ์นี้น่าสนใจเพราะแสดงให้เห็นว่า Claude ไม่ได้เป็นแค่เครื่องมือช่วยเขียนโค้ด แต่สามารถเป็นตัวตัดสินผลของภารกิจเจาะระบบจริงได้ เมื่อโมเดลรุ่นเก่ายังทำไม่สำเร็จ แต่โมเดลรุ่นใหม่ที่เพิ่งเปิดตัวกลับปิดงานได้ในเวลาไม่กี่ชั่วโมง
ช่องโหว่เริ่มจากไฟล์ภาพ HEIF ธรรมดาบนฟอรัมพนักงาน
OpenAI ใช้ Discourse เป็นฟอรัมสนทนาภายในสำหรับพนักงาน เมื่อมีการอัปโหลดไฟล์ภาพสกุล HEIF/HEIC ระบบจะส่งไฟล์นั้นผ่าน ImageMagick ซึ่งเรียกไลบรารี libheif มาถอดรหัสและแปลงเป็นไฟล์ภาพชนิดอื่นอีกที ทีม Hacktron AI พบว่า libheif มีบั๊กด้านหน่วยความจำจากการคำนวณตำแหน่งภาพผิดพลาด ซึ่งเปิดช่องให้ไฟล์ภาพที่ถูกประดิษฐ์ขึ้นมาเป็นพิเศษสามารถเจาะเข้าไปควบคุมฝั่งเซิร์ฟเวอร์ได้
จากช่องโหว่นี้ ทีมงานไล่ต่อจนยึดบัญชี ChatGPT และ Codex ของพนักงาน OpenAI หลายคนได้สำเร็จ และเนื่องจากบัญชี Codex เหล่านั้นเชื่อมกับองค์กร GitHub ของ OpenAI โดยตรง ทีมงานจึงสามารถเปิด pull request ที่ดูไม่มีพิษภัยเพื่อยืนยันว่าเข้าถึง repository ภายในได้จริง ทั้งกระบวนการตั้งแต่พบช่องทางแรกในวันที่ 25 กรกฎาคม จนถึงเข้าถึง repo ภายใน ใช้เวลารวมไม่ถึง 72 ชั่วโมง ส่วน Discourse ออกแพตช์ปิดช่องโหว่ในวันที่ 27 กรกฎาคม

จุดเปลี่ยนสำคัญ: Opus 4.8 ทำไม่สำเร็จ แต่ Opus 5 ปิดงานได้ในไม่กี่ชั่วโมง
ตอนแรกทีมงานป้อนโจทย์การประกอบ exploit จากบั๊ก libheif ให้ Claude Opus 4.8 ลองทำ แต่โมเดลรุ่นนี้สร้าง exploit ที่ใช้งานได้จริงไม่สำเร็จ พอ Anthropic เปิดตัว Claude Opus 5 ทีมงานก็นำโจทย์เดิมกลับมาให้ลองใหม่อีกครั้ง คราวนี้ Opus 5 สร้าง exploit ที่ใช้งานได้จริงสำเร็จภายในเวลาไม่กี่ชั่วโมงหลังเปิดตัว
| Factor | Claude Opus 4.8 | Claude Opus 5 |
|---|---|---|
| ผลลัพธ์การสร้าง exploit จากบั๊ก libheif | สร้าง exploit ที่ใช้งานจริงไม่สำเร็จ | สร้าง exploit ที่ใช้งานจริงได้สำเร็จ |
| เวลาที่ใช้จนได้ exploit ที่ทำงานได้ | ไม่สำเร็จแม้ลองหลายครั้ง | ไม่กี่ชั่วโมงหลังเปิดตัวรุ่นใหม่ |

ช่องว่างระหว่างสองรุ่นนี้บอกอะไรได้ชัดเจนกว่าคำอธิบายฝ่ายการตลาด เพราะเป็นการทดสอบด้วยโจทย์เดียวกันเป๊ะ ต่างกันแค่รุ่นโมเดลที่ใช้ ผลลัพธ์จึงสะท้อนความสามารถด้าน exploit development ที่พัฒนาขึ้นจริงระหว่างรุ่น ไม่ใช่แค่ตัวเลข benchmark ทั่วไป
จากบัญชีพนักงาน สู่ประตูเข้า GitHub ขององค์กร
จุดที่ทำให้เคสนี้ถูกจับตามองเป็นพิเศษคือระยะที่สอง หลังยึดบัญชี ChatGPT ได้แล้ว ทีมงานไม่ได้หยุดแค่นั้น แต่ไล่ต่อไปจนถึงบัญชี Codex ที่ผูกกับ GitHub องค์กรของ OpenAI แล้วเปิด pull request จริงเพื่อพิสูจน์ว่าการเข้าถึง repository ภายในไม่ใช่แค่ทฤษฎี นี่คือสิ่งที่ทำให้ OpenAI มองว่าช่องโหว่นี้มีผลกระทบสูง และจ่ายรางวัลผ่านโครงการ bug bounty บน Bugcrowd ให้ทีม Hacktron AI เป็นเงิน 6,500 ดอลลาร์

บทเรียนสำหรับทีมความปลอดภัยในยุคที่ AI ช่วยแฮ็กได้เร็วขึ้น
เคสนี้เตือนสองเรื่องพร้อมกัน เรื่องแรกคือช่องโหว่เล็กๆ ในไลบรารีประมวลผลภาพอย่าง libheif ที่หลายระบบใช้งานโดยไม่รู้ตัวว่ามีความเสี่ยง สามารถกลายเป็นจุดเริ่มต้นของการเจาะระบบระดับองค์กรได้ทั้งสาย เรื่องที่สองคือ เมื่อโมเดล AI รุ่นใหม่ทำให้การประกอบ exploit จากช่องโหว่ที่รู้อยู่แล้วเร็วขึ้นมาก ทีมความปลอดภัยฝั่ง defense ก็ต้องปิดแพตช์เร็วขึ้นตามไปด้วย อย่างที่ Discourse ทำได้ภายในสองวันหลังพบช่องทาง
ผมมองว่าเคสนี้เป็นตัวอย่างที่ดีของการใช้ AI ในงานความปลอดภัยแบบมีขอบเขตชัดเจน ทุกขั้นตอนอยู่ในโครงการ bug bounty ที่ได้รับอนุญาต ไม่ใช่การโจมตีลับๆ และผลลัพธ์สุดท้ายก็ถูกรายงานกลับไปให้ OpenAI แก้ไขแทนที่จะถูกนำไปใช้ในทางที่เสียหาย นี่คือรูปแบบที่องค์กรอื่นน่าจะเริ่มมองหาไว้ใช้ตรวจสอบระบบของตัวเองบ้างนะ