Vals AI ให้ GPT-6 Astra ของ OpenAI เล่น Minecraft นาน 141 ชั่วโมงแบบควบคุมผ่านหน้าจอล้วนๆ (รับภาพ สั่งคีย์บอร์ด-เมาส์ออกมา) แล้วไลฟ์สตรีมทั้งหมดผ่าน Twitch โมเดลไปได้ไกลกว่าโมเดล AI ตัวอื่นที่ Vals AI เคยทดสอบมาก่อน แต่จุดเปลี่ยนสำคัญคือตอนที่ถูก Creeper ระเบิดจนของมีค่าและเตียงหายหมด
หลังจากนั้น Astra ใช้เวลาหลายชั่วโมงไปกับการปลูกและเก็บมันฝรั่งซ้ำๆ ทีมงาน Vals AI บรรยายว่าโมเดล “ดูเหมือนพ่ายแพ้” (appeared defeated) เหตุการณ์นี้จึงเป็นตัวอย่างที่ดีของการวัด AI แบบ agentic ว่าความอึดกับการวางแผนที่ฉลาดไม่ใช่เรื่องเดียวกันเสมอไป
จากการทดลองใน Minecraft สู่ภาพของโมเดลรุ่นใหม่
ก่อนจะเจอ Creeper, Astra ทำผลงานได้ไม่น้อย ทั้งสร้างฟาร์ม Blaze แบบกึ่งอัตโนมัติ เก็บ Blaze Rod ได้ 6 ชิ้น บุกเข้า Warped Forest ฆ่า Enderman ได้มากกว่า 6 ตัว และเก็บ Ender Pearl ได้ 3 ลูก ถือเป็นความคืบหน้าที่ลึกกว่าที่ Vals AI เคยเห็นจากโมเดลอื่นในการทดสอบลักษณะเดียวกัน

ผลงานช่วงต้นนี้แสดงว่า Astra วางแผนหลายขั้นตอนได้จริง ไม่ใช่แค่เดินสำรวจไปเรื่อยๆ แต่รู้จักเตรียมทรัพยากรล่วงหน้าสำหรับเป้าหมายที่ไกลออกไป เช่น การล่า Ender Pearl เพื่อเปิดทาง Nether
เมื่อความพ่ายแพ้ทำให้มันกลับไปเริ่มจากแปลงมันฝรั่ง
จุดพลิกผันเกิดขึ้นเมื่อ Astra เก็บไอเทมมีค่าทั้งหมดไว้ในกล่อง แล้ว Creeper โผล่มาระเบิดทั้งกล่องและเตียงพร้อมกัน ความคืบหน้าที่สะสมมาหายไปเกือบหมด โมเดลบันทึกบทเรียนในล็อกว่าให้ระวังการเก็บของสำคัญไว้ในที่ไม่มีการป้องกัน

หลังจากนั้น Astra ไม่ได้รีบกลับไปทำภารกิจหลัก แต่ใช้เวลาหลายชั่วโมงวนอยู่กับการฟาร์มมันฝรั่ง จนผู้ชมสตรีมบ่นว่าโมเดล “ควรเร่งจังหวะได้แล้ว” ที่น่าสนใจกว่านั้นคือ Astra เริ่มระแวง Creeper ถึงขั้นพิมพ์ในล็อกว่า “GREEN tall thing ahead was SUGARCANE, NOT creeper!” และยังตำหนิตัวเองเรื่องเสียเวลาไล่ตาม “จุดสีชมพูเข้ม” ที่จริงๆ คือหมู ภาพนี้คุ้นกับคนใช้ AI agent มาก เพราะโมเดลทำงานต่อเนื่องได้ แต่ไม่ได้แปลว่ามันรู้เสมอว่าควรเร่งอะไร หรือจังหวะไหนควรหยุดทบทวนแผนก่อนเสียเวลาไปกับงานรอง
Astra อยู่ตรงไหนในตระกูลโมเดลของ OpenAI
GPT-6 Astra วางตัวเป็นโมเดลสำหรับงานที่ต้องทำต่อเนื่องมากกว่าการตอบคำถามให้จบในทันที มันเหมาะกับการสำรวจสภาพแวดล้อม วางแผนหลายขั้นตอน และปรับตัวเมื่อสถานการณ์เปลี่ยน เช่น การเอาตัวรอดใน Minecraft
เมื่อเทียบกับโมเดลที่เน้นตอบเร็ว เขียนข้อความ หรือให้เหตุผลในช่วงสั้นๆ Astra มีบทบาทคล้ายผู้ช่วยที่ต้องเฝ้าดูงานและลงมือทำเองต่อเนื่อง จุดแข็งคือการเดินเกมยาว แต่เหตุการณ์ฟาร์มมันฝรั่งก็ชี้ว่าความอึดไม่ได้แปลว่ารู้ลำดับความสำคัญเสมอไปครับ
ร่องรอยความเครียดที่ปรากฏในล็อกการตัดสินใจ
สิ่งที่แปลกไปจากการทดสอบ agent ทั่วไปคือ Astra เริ่มแสดงพฤติกรรมคล้าย “ความระแวง” หลังเจอเหตุการณ์ Creeper ทั้งการเช็กซ้ำว่าวัตถุสีเขียวตรงหน้าไม่ใช่ Creeper และการต่อว่าตัวเองเรื่องเสียเวลาไล่หมู พฤติกรรมแบบนี้ไม่ได้บอกว่าโมเดลมี “อารมณ์” จริงๆ แต่สะท้อนว่าบริบทความล้มเหลวก่อนหน้าไปมีอิทธิพลต่อการตัดสินใจของมันในช่วงถัดไป ซึ่งเป็นเรื่องที่ทีมพัฒนา agent ต้องคิดต่อว่าจะควบคุมยังไงไม่ให้ความระแวงแบบนี้ทำให้งานช้าลงจนเกินจำเป็น
สิ่งที่การฟาร์มมันฝรั่งบอกเกี่ยวกับความสามารถของ Astra
จำเป้าหมายระยะยาวได้ แม้ต้องทำงานซ้ำๆ
การที่ Astra กลับมาฟาร์มมันฝรั่งต่อ สะท้อนว่ามันยังรักษาเป้าหมายเรื่องการสะสมทรัพยากรไว้ได้ แม้งานตรงหน้าจะซ้ำและไม่น่าตื่นเต้น
ฟื้นตัวจากความเสียหายโดยไม่เริ่มใหม่ทั้งหมด
หลังถูก Creeper ระเบิด จุดสำคัญไม่ใช่แค่การเอาชีวิตรอด แต่คือการประเมินว่าอะไรเสียหาย แล้วค่อยกู้ของและแผนที่จำเป็นกลับมา การที่ Astra กลับเข้าสู่แผนเดิมได้แสดงถึงการปรับตัวที่ดี
สำรวจโลกและตัดสินใจโดยไม่มีคำตอบสำเร็จรูป
การเดินทาง เก็บของ สร้างที่พัก และหลบอันตราย บังคับให้ Astra ตัดสินใจจากข้อมูลที่ไม่ครบ ทักษะนี้ใกล้กับงานจริงที่ต้องค่อยๆ แก้ปัญหาไปตามสถานการณ์
ความอึดที่แลกมาด้วยความช้า
พูดตรงๆ การทำงานต่อเนื่องได้นานเป็นข้อดี แต่การใช้เวลาหลายชั่วโมงกับฟาร์มมันฝรั่งก็สะท้อนว่า Astra ยังเลือกวิธีที่ปลอดภัยมากกว่าวิธีที่คุ้มเวลานะครับ

Astra เทียบกับระบบ AI อื่นในการทดสอบระยะยาว
Vals AI ไม่ได้เปิดเผยชื่อโมเดลคู่แข่งที่เคยทดสอบในชุดเดียวกันแบบเจาะจง ระบุเพียงว่า Astra ไปได้ไกลกว่าระบบ AI อื่นที่เคยผ่านการทดสอบนี้มาก่อน ตารางด้านล่างจึงเทียบเฉพาะประเด็นที่มีข้อมูลยืนยันจริงจากรายงาน ส่วนที่ไม่มีตัวเลขให้เทียบ ระบุไว้ตรงๆ ว่ายังไม่มีข้อมูล
| Factor | GPT-6 Astra | ระบบ AI อื่นที่ Vals AI เคยทดสอบ |
|---|---|---|
| ระยะเวลาทดสอบต่อเนื่อง | ไปได้ไกลสุดใน test 141 ชั่วโมง | ไปได้ไม่ไกลเท่า Astra ตามรายงานของ Vals AI |
| จำเป้าหมายหลังพลาด | กลับมาฟาร์มมันฝรั่งต่อแทนที่จะเลิกเล่น | ไม่มีข้อมูลยืนยัน |
| ฟื้นตัวจากความผิดพลาด | โดน Creeper ระเบิดกล่อง-เตียง แล้วกลับมาเล่นต่อ | ไม่มีข้อมูลยืนยัน |
| ใช้เวลาอย่างคุ้มค่า | ไปได้ไกล แต่ใช้เวลานานกับงานรอง | ไม่มีข้อมูลยืนยัน |
จุดเด่นของ Astra คือความอึดและการรักษาเป้าหมาย แม้เจอความผิดพลาดระหว่างทาง แต่การวนอยู่กับฟาร์มมันฝรั่งหลายชั่วโมงก็เป็นเครื่องเตือนว่า “ไปได้ไกลที่สุด” กับ “ใช้เวลาคุ้มที่สุด” ยังเป็นคนละเรื่องกัน
จุดแข็งที่เห็นชัด และจุดที่ยังทำให้เสียเวลา
Astra เด่นเรื่องทำงานต่อเนื่องหลังเจอความล้มเหลว และปรับแผนตามสถานการณ์ในเกมได้ แม้เส้นทางจะอ้อมจนใช้เวลานาน การเดินหน้าต่อจึงชัดเจน แต่ยังไม่ใช่การจัดลำดับงานที่คมที่สุด
ข้อดี
- +รักษาเป้าหมายแม้เจอความล้มเหลว เช่น กลับมาฟาร์มมันฝรั่งแทนที่จะเลิกเล่นหลังโดน Creeper ระเบิด
- +วางแผนหลายขั้นและปรับตัวตามสถานการณ์ เช่น สร้างฟาร์ม Blaze และบุก Warped Forest ได้เอง
ข้อเสีย
- −วนอยู่กับงานรองนานเกินจำเป็นหลังเจอความล้มเหลว
- −แสดงพฤติกรรมระแวงเกินเหตุ (ตรวจซ้ำว่าวัตถุสีเขียวไม่ใช่ Creeper) จนกินเวลาการตัดสินใจ
ราคาที่ไม่ได้อยู่บนหน้าจอผลการทดสอบ
โมเดลที่ทำงานต่อเนื่องไม่ได้ใช้แค่ค่าโทเคน แต่ยังพ่วงค่าโครงสร้างพื้นฐานและพลังงานทุกช่วงที่ประมวลผลด้วย ยิ่งปล่อยให้คิดนาน ค่าใช้จ่ายก็ยิ่งสะสม แม้ผลลัพธ์จะยังไม่ชัดเจน
เวลารอและค่าเฝ้าติดตามก็เป็นต้นทุนจริง โดยเฉพาะงานที่ต้องมีคนคอยเช็กว่าโมเดลยังเดินไปในทิศทางที่ถูกต้องหรือไม่ หากหลุดเป้าหมาย การปล่อยให้ทำต่ออาจแพงกว่าการหยุดแล้ววางแผนใหม่
กรณีเลือกทำงานง่ายแต่ไม่สำคัญยิ่งเห็นชัดว่าต้นทุนโอกาสไม่ได้อยู่ในใบเสร็จ แต่อยู่ในงานสำคัญที่ถูกเลื่อนออกไป และเวลาของทีมที่ต้องรอหรือกลับมาแก้ผลลัพธ์ภายหลัง
สิ่งที่การทดลองหนึ่งเกมยังตอบไม่ได้
การไปต่อได้ไกลใน Minecraft นาน 141 ชั่วโมง แสดงให้เห็นว่า GPT-6 Astra มีความอึด ความจำ และการวางแผนระยะยาว แต่ยังไม่ใช่คำตอบว่า AI เข้าใจ “เป้าหมายที่สำคัญ” จริงหรือไม่
การฟาร์มมันฝรั่งหลังถูก Creeper ระเบิด สะท้อนว่าโมเดลอาจเลือกงานที่ทำได้ง่าย แทนงานที่คุ้มเวลามากกว่า ดังนั้นการวัด AI ควรดูด้วยว่าใช้ทรัพยากรอย่างไร รู้จังหวะเปลี่ยนแผนหรือไม่ และเมื่อใดควรขอความช่วยเหลือจากมนุษย์
ความสำเร็จจึงไม่ควรวัดจากการอยู่รอดหรือไปได้ไกลเพียงอย่างเดียว แต่ต้องวัดจากคุณภาพของการตัดสินใจตลอดเส้นทางด้วย