หน้าแรก / บทความ / AI & LLM
AI & LLM วิเคราะห์จากสเปค + รีวิว

วิเคราะห์และรีวิว: นักวิจัยด้านความปลอดภัยใช้ Claude ช่วยแฮ็ก OpenAI

ทีม Hacktron AI ใช้ Claude ไล่หาช่องโหว่ HEIF บนฟอรัมของ OpenAI จนแฮ็กบัญชีพนักงานและเข้าถึง repo ภายในได้ ภายใต้โครงการ bug bounty ที่ได้รับอนุญาต

วิเคราะห์และรีวิว: นักวิจัยด้านความปลอดภัยใช้ Claude ช่วยแฮ็ก OpenAI

TL;DR: ทีมวิจัยความปลอดภัย Hacktron AI ใช้ Claude ไล่ประกอบช่องโหว่ในไฟล์ภาพ HEIF บนฟอรัม Discourse ของ OpenAI จนแฮ็กบัญชี ChatGPT ของพนักงานหลายคน และต่อยอดไปถึง repository ภายในได้สำเร็จ ทั้งหมดเกิดขึ้นภายใต้โครงการ bug bounty ที่ OpenAI อนุญาตไว้ล่วงหน้า ไม่ใช่การโจมตีที่ผิดกฎหมาย

Hacktron AI สตาร์ทอัพด้านความปลอดภัยไซเบอร์ทีมเล็กเพียง 3 คน นำโดยผู้ก่อตั้ง Mohan Pedhapati ใช้ Claude เป็นผู้ช่วยไล่หาและประกอบช่องโหว่ จนสามารถเข้าควบคุมบัญชี ChatGPT ของพนักงาน OpenAI หลายคน แล้วต่อยอดไปถึงการเข้าถึง repository ภายในองค์กรได้จริง งานทั้งหมดอยู่ภายใต้โครงการ bug bounty ของ OpenAI บน Bugcrowd ซึ่งเป็นการทดสอบที่ได้รับอนุญาตล่วงหน้า ไม่ใช่การเจาะระบบผิดกฎหมายแต่อย่างใด

เหตุการณ์นี้น่าสนใจเพราะแสดงให้เห็นว่า Claude ไม่ได้เป็นแค่เครื่องมือช่วยเขียนโค้ด แต่สามารถเป็นตัวตัดสินผลของภารกิจเจาะระบบจริงได้ เมื่อโมเดลรุ่นเก่ายังทำไม่สำเร็จ แต่โมเดลรุ่นใหม่ที่เพิ่งเปิดตัวกลับปิดงานได้ในเวลาไม่กี่ชั่วโมง

ช่องโหว่เริ่มจากไฟล์ภาพ HEIF ธรรมดาบนฟอรัมพนักงาน

OpenAI ใช้ Discourse เป็นฟอรัมสนทนาภายในสำหรับพนักงาน เมื่อมีการอัปโหลดไฟล์ภาพสกุล HEIF/HEIC ระบบจะส่งไฟล์นั้นผ่าน ImageMagick ซึ่งเรียกไลบรารี libheif มาถอดรหัสและแปลงเป็นไฟล์ภาพชนิดอื่นอีกที ทีม Hacktron AI พบว่า libheif มีบั๊กด้านหน่วยความจำจากการคำนวณตำแหน่งภาพผิดพลาด ซึ่งเปิดช่องให้ไฟล์ภาพที่ถูกประดิษฐ์ขึ้นมาเป็นพิเศษสามารถเจาะเข้าไปควบคุมฝั่งเซิร์ฟเวอร์ได้

จากช่องโหว่นี้ ทีมงานไล่ต่อจนยึดบัญชี ChatGPT และ Codex ของพนักงาน OpenAI หลายคนได้สำเร็จ และเนื่องจากบัญชี Codex เหล่านั้นเชื่อมกับองค์กร GitHub ของ OpenAI โดยตรง ทีมงานจึงสามารถเปิด pull request ที่ดูไม่มีพิษภัยเพื่อยืนยันว่าเข้าถึง repository ภายในได้จริง ทั้งกระบวนการตั้งแต่พบช่องทางแรกในวันที่ 25 กรกฎาคม จนถึงเข้าถึง repo ภายใน ใช้เวลารวมไม่ถึง 72 ชั่วโมง ส่วน Discourse ออกแพตช์ปิดช่องโหว่ในวันที่ 27 กรกฎาคม

ไดอะแกรมช่องโหว่ไฟล์ภาพ HEIF ที่ถูกใช้เจาะระบบฟอรัม Discourse ของ OpenAI

จุดเปลี่ยนสำคัญ: Opus 4.8 ทำไม่สำเร็จ แต่ Opus 5 ปิดงานได้ในไม่กี่ชั่วโมง

ตอนแรกทีมงานป้อนโจทย์การประกอบ exploit จากบั๊ก libheif ให้ Claude Opus 4.8 ลองทำ แต่โมเดลรุ่นนี้สร้าง exploit ที่ใช้งานได้จริงไม่สำเร็จ พอ Anthropic เปิดตัว Claude Opus 5 ทีมงานก็นำโจทย์เดิมกลับมาให้ลองใหม่อีกครั้ง คราวนี้ Opus 5 สร้าง exploit ที่ใช้งานได้จริงสำเร็จภายในเวลาไม่กี่ชั่วโมงหลังเปิดตัว

Factor Claude Opus 4.8Claude Opus 5
ผลลัพธ์การสร้าง exploit จากบั๊ก libheif สร้าง exploit ที่ใช้งานจริงไม่สำเร็จสร้าง exploit ที่ใช้งานจริงได้สำเร็จ
เวลาที่ใช้จนได้ exploit ที่ทำงานได้ ไม่สำเร็จแม้ลองหลายครั้งไม่กี่ชั่วโมงหลังเปิดตัวรุ่นใหม่
เปรียบเทียบผลลัพธ์การสร้าง exploit ระหว่าง Claude Opus 4.8 กับ Opus 5

ช่องว่างระหว่างสองรุ่นนี้บอกอะไรได้ชัดเจนกว่าคำอธิบายฝ่ายการตลาด เพราะเป็นการทดสอบด้วยโจทย์เดียวกันเป๊ะ ต่างกันแค่รุ่นโมเดลที่ใช้ ผลลัพธ์จึงสะท้อนความสามารถด้าน exploit development ที่พัฒนาขึ้นจริงระหว่างรุ่น ไม่ใช่แค่ตัวเลข benchmark ทั่วไป

จากบัญชีพนักงาน สู่ประตูเข้า GitHub ขององค์กร

จุดที่ทำให้เคสนี้ถูกจับตามองเป็นพิเศษคือระยะที่สอง หลังยึดบัญชี ChatGPT ได้แล้ว ทีมงานไม่ได้หยุดแค่นั้น แต่ไล่ต่อไปจนถึงบัญชี Codex ที่ผูกกับ GitHub องค์กรของ OpenAI แล้วเปิด pull request จริงเพื่อพิสูจน์ว่าการเข้าถึง repository ภายในไม่ใช่แค่ทฤษฎี นี่คือสิ่งที่ทำให้ OpenAI มองว่าช่องโหว่นี้มีผลกระทบสูง และจ่ายรางวัลผ่านโครงการ bug bounty บน Bugcrowd ให้ทีม Hacktron AI เป็นเงิน 6,500 ดอลลาร์

เส้นทางการโจมตีจากบัญชี ChatGPT พนักงานไปจนถึงการเข้าถึง repository ภายในของ OpenAI

บทเรียนสำหรับทีมความปลอดภัยในยุคที่ AI ช่วยแฮ็กได้เร็วขึ้น

เคสนี้เตือนสองเรื่องพร้อมกัน เรื่องแรกคือช่องโหว่เล็กๆ ในไลบรารีประมวลผลภาพอย่าง libheif ที่หลายระบบใช้งานโดยไม่รู้ตัวว่ามีความเสี่ยง สามารถกลายเป็นจุดเริ่มต้นของการเจาะระบบระดับองค์กรได้ทั้งสาย เรื่องที่สองคือ เมื่อโมเดล AI รุ่นใหม่ทำให้การประกอบ exploit จากช่องโหว่ที่รู้อยู่แล้วเร็วขึ้นมาก ทีมความปลอดภัยฝั่ง defense ก็ต้องปิดแพตช์เร็วขึ้นตามไปด้วย อย่างที่ Discourse ทำได้ภายในสองวันหลังพบช่องทาง

ผมมองว่าเคสนี้เป็นตัวอย่างที่ดีของการใช้ AI ในงานความปลอดภัยแบบมีขอบเขตชัดเจน ทุกขั้นตอนอยู่ในโครงการ bug bounty ที่ได้รับอนุญาต ไม่ใช่การโจมตีลับๆ และผลลัพธ์สุดท้ายก็ถูกรายงานกลับไปให้ OpenAI แก้ไขแทนที่จะถูกนำไปใช้ในทางที่เสียหาย นี่คือรูปแบบที่องค์กรอื่นน่าจะเริ่มมองหาไว้ใช้ตรวจสอบระบบของตัวเองบ้างนะ