Apple เพิ่งเผยแพร่เอกสารอธิบายฟีเจอร์ฟังเสียงชุดใหม่ที่มาพร้อม Apple Watch Series 12 และ Apple Watch Ultra 4 ประเด็นสำคัญไม่ใช่แค่ว่านาฬิกาฟังอะไรได้บ้าง แต่คือ Apple อธิบายไว้ชัดแค่ไหนว่าเสียงที่ไมโครโฟนรับเข้าไปถูกประมวลผลที่ไหน เก็บไว้นานเท่าไร และมีใครเข้าถึงได้บ้าง
พูดตรงๆ เอกสารฉบับนี้เขียนได้ละเอียดกว่าที่คาด แต่ก็ยังทิ้งคำถามบางข้อไว้โดยไม่มีคำตอบ โดยเฉพาะเรื่องคนที่อยู่รอบตัวผู้ใช้ ซึ่งไม่ได้เป็นคนกดเปิดฟีเจอร์เอง แต่เสียงของพวกเขาอาจถูกแปลงเป็นข้อความไปด้วย
เอกสารฉบับนี้อธิบายอะไร: 4 ฟีเจอร์ฟังเสียงใหม่บน Apple Watch
ฟีเจอร์ทั้งหมดอยู่ภายใต้ชื่อรวมว่า Audio Intelligence และแบ่งออกเป็นสี่ตัว
Sound Recognition ให้นาฬิกาคอยฟังเสียงเฉพาะทาง เช่น เสียงเตือนควันไฟหรือเสียงเด็กร้อง แล้วแจ้งเตือนผู้ใช้ทันทีที่ตรวจพบ
Music Recognition ทำงานผ่าน Shazam โดยส่งออกไปแค่ “ลายนิ้วมือเสียง” (audio fingerprint) เพื่อจับคู่เพลง ไม่ใช่ไฟล์เสียงจริงที่บันทึกไว้
Live Rewind ให้ผู้ใช้กดปุ่ม Digital Crown สองครั้งเพื่อย้อนฟังคำพูด 15 วินาทีล่าสุดที่เพิ่งพลาดไป ข้อความที่ถอดได้จะหายไปเองภายใน 30 วินาทีถ้าไม่ได้กดบันทึกเก็บไว้
Siri Recap ใช้บันทึกบทสนทนาในการประชุมที่มีอยู่ในปฏิทิน แล้วสรุปเป็นข้อความสั้นๆ ให้อ่านย้อนหลังได้ ก่อนจะลบข้อมูลทิ้งอัตโนมัติภายในเจ็ดวัน

S11 กับ Secure Exclave ห้องที่กันเสียงไม่ให้หลุดออกจากตัวเครื่อง
หัวใจของฟีเจอร์ทั้งหมดคือชิป S11 บน Apple Watch Series 12 และ Ultra 4 ซึ่งมีส่วนที่เรียกว่า Secure Exclave แยกออกมาต่างหากจากส่วนประมวลผลหลักของนาฬิกา
เสียงที่ไมโครโฟนรับเข้ามาจะถูกส่งเข้า Secure Exclave ทันที เพื่อตรวจจับคำพูด เสียง หรือเพลง โดยไม่มีการถอดข้อความหรือบันทึกเป็นไฟล์เสียงในขั้นตอนนี้ ข้อมูลที่ไหลอยู่ในนั้นเป็นบัฟเฟอร์ที่ถูกเขียนทับต่อเนื่อง ไม่เคยกลายเป็นไฟล์บันทึกเสียงจริง และ watchOS แอปต่างๆ ผู้ใช้ หรือแม้แต่ Apple เองก็เข้าถึงข้อมูลในส่วนนี้ไม่ได้
เมื่อข้อมูลเสียงต้องเดินทางออกจากนาฬิกาไปหา iPhone และ iCloud
ฟีเจอร์อย่าง Siri Recap ต้องอาศัย iPhone 16 ขึ้นไปเพื่อประมวลผลร่วมกัน เมื่อข้อมูลต้องส่งออกจากนาฬิกาไปยังโทรศัพท์ Apple ระบุว่าการเชื่อมต่อนี้เข้ารหัสผ่าน Secure Exclave ทั้งสองฝั่ง
ถ้าผู้ใช้เลือกซิงก์ข้อมูลขึ้น iCloud ต่อ การปกป้องจะขึ้นอยู่กับการเข้ารหัสแบบ end-to-end ซึ่งผูกกับรหัสผ่านเครื่องและการยืนยันตัวตนสองชั้น พูดง่ายๆ คือทุกจุดที่ข้อมูลเสียงเคลื่อนออกจากฮาร์ดแวร์ที่ปิดสนิท จะต้องผ่านชั้นเข้ารหัสเพิ่มอีกชั้นเสมอ
Live Rewind กับ Siri Recap ต่างกันตรงไหน
สองฟีเจอร์นี้มักถูกเข้าใจสลับกัน ทั้งที่จุดประสงค์และรูปแบบการเก็บข้อมูลต่างกันชัดเจน
| Factor | Live Rewind | Siri Recap |
|---|---|---|
| วิธีเปิดใช้งาน | กดปุ่ม Digital Crown สองครั้งทุกครั้งที่ต้องการ | ทำงานตามกำหนดการประชุมในปฏิทิน |
| ช่วงเวลาที่บันทึก | ย้อนหลังสูงสุด 15 วินาที | ตลอดช่วงการประชุมที่กำหนดไว้ |
| อายุของข้อมูล | หายอัตโนมัติใน 30 วินาทีถ้าไม่กดเก็บ | ลบอัตโนมัติภายใน 7 วัน |
| การแจ้งเตือนคนรอบข้าง | มีสัญญาณเสียงและภาพตอนเปิดใช้งาน | ไม่มีการแจ้งเตือนคนรอบข้างระหว่างบันทึก |
ความต่างที่สำคัญที่สุดอยู่ที่แถวสุดท้าย Live Rewind ต้องอาศัยผู้ใช้กดเปิดเองทุกครั้งและมีสัญญาณให้คนแถวนั้นสังเกตเห็น ขณะที่ Siri Recap ทำงานเงียบกว่ามากเมื่อประชุมเริ่มตามเวลาที่ตั้งไว้
ความยินยอมของคนรอบข้างคือช่องโหว่ที่เอกสารไม่ได้พูดถึง
เอกสารของ Apple อธิบายกลไกทางเทคนิคไว้ละเอียดมาก แต่แทบไม่ได้แตะประเด็นที่ว่า คนที่อยู่ตรงหน้าผู้ใช้ ซึ่งเสียงของพวกเขาอาจถูกแปลงเป็นข้อความไปด้วย ได้ให้ความยินยอมหรือไม่
Siri Recap เป็นตัวอย่างที่ชัดที่สุด เพราะทำงานอัตโนมัติตามตารางนัดหมายโดยไม่มีการแจ้งเตือนให้คนอื่นในห้องรู้ ส่วน Live Rewind แม้จะมีสัญญาณเสียงและไฟกะพริบตอนเปิดใช้งาน แต่สัญญาณเหล่านี้ก็ไม่ได้การันตีว่าทุกคนในวงสนทนาจะสังเกตเห็นหรือเข้าใจความหมายของมัน
เรื่องความยินยอมของหลายฝ่ายในการสนทนายังไม่มีคำตอบทางกฎหมายที่ชัดเจนในหลายประเทศ ซึ่งเป็นช่องว่างที่อยู่นอกเหนือขอบเขตของเอกสารทางเทคนิคฉบับนี้ไปแล้ว

สิ่งที่ทำได้ดีจริง กับสิ่งที่ยังต้องระวัง
ข้อดี
- +เสียงดิบถูกประมวลผลใน Secure Exclave เท่านั้น ไม่ถูกบันทึกเป็นไฟล์และไม่มีแอปหรือ Apple เข้าถึงได้
- +Live Rewind ต้องอาศัยการกดเปิดใช้งานของผู้ใช้เองทุกครั้ง ไม่ได้ทำงานแบบเงียบตลอดเวลา
- +ข้อมูลที่ต้องส่งออกจากตัวเครื่องผ่านการเข้ารหัสทั้งระหว่างอุปกรณ์และตอนซิงก์ขึ้น iCloud
ข้อเสีย
- −Siri Recap ทำงานอัตโนมัติตามตารางนัดโดยไม่มีการแจ้งเตือนคนรอบข้างในขณะนั้น
- −ความยินยอมของคนที่ไม่ได้เป็นเจ้าของอุปกรณ์ยังเป็นช่องว่างที่เอกสารไม่ได้ตอบ
- −ฟีเจอร์ที่ต้องเชื่อมกับ iPhone อย่าง Siri Recap ต้องใช้ iPhone 16 ขึ้นไปเท่านั้น
แนวทางของ Apple ต่างจากผู้ช่วยเสียงที่พึ่งคลาวด์อย่างไร
| Factor | Audio Intelligence (Apple Watch) | ผู้ช่วยเสียงที่พึ่งคลาวด์ทั่วไป |
|---|---|---|
| จุดที่ประมวลผลเสียงดิบ | ภายใน Secure Exclave บนตัวเครื่อง | ส่งขึ้นเซิร์ฟเวอร์เพื่อประมวลผลเป็นส่วนใหญ่ |
| การเก็บไฟล์เสียง | ไม่บันทึกเป็นไฟล์ในขั้นตอนตรวจจับ | มักถูกเก็บไว้เพื่อปรับปรุงบริการ |
| การเปิดใช้งาน | ต้องกดหรือกำหนดตารางล่วงหน้า | มักทำงานต่อเนื่องเมื่อได้รับคำสั่งปลุก |
| การแจ้งเตือนคนรอบข้าง | มีเฉพาะบางฟีเจอร์ เช่น Live Rewind | แทบไม่มีสัญญาณแจ้งเตือนคนรอบข้าง |
จุดต่างที่ชัดเจนคือ Apple พยายามกันเสียงดิบไม่ให้ออกจากฮาร์ดแวร์เฉพาะของตัวเองตั้งแต่ต้นทาง ขณะที่ผู้ช่วยเสียงที่พึ่งคลาวด์ส่วนใหญ่ยังต้องส่งเสียงไปประมวลผลไกลจากตัวเครื่องเพื่อให้ทำงานได้แม่นยำ แต่ก็อย่างที่บอกไป การประมวลผลบนเครื่องแก้ปัญหาเรื่องข้อมูลรั่วออกนอกอุปกรณ์ได้ดี ทว่าไม่ได้แก้ปัญหาเรื่องความยินยอมของคนรอบข้างเลยครับ
ก่อนเปิดใช้ฟีเจอร์ฟังเสียงใหม่ ควรเช็กอะไรบ้าง

ก่อนเปิดใช้ Audio Intelligence บน Apple Watch ควรตรวจสามเรื่องหลัก คือฟีเจอร์ไหนทำงานอัตโนมัติตามตารางแบบ Siri Recap และฟีเจอร์ไหนต้องกดเปิดเองแบบ Live Rewind ข้อมูลที่ถอดได้แต่ละแบบถูกเก็บไว้นานแค่ไหนก่อนลบทิ้งอัตโนมัติ และตัวเองพร้อมจะแจ้งให้คนรอบข้างรู้หรือไม่เมื่อเปิดฟีเจอร์ที่บันทึกบทสนทนา
เอกสารของ Apple ตอบคำถามฝั่งเทคนิคได้ค่อนข้างครบ แต่เรื่องความยินยอมของคนที่ไม่ได้ถืออุปกรณ์เองยังเป็นสิ่งที่ผู้ใช้ต้องจัดการด้วยตัวเอง ไม่ใช่แค่เชื่อว่าฮาร์ดแวร์ปลอดภัยแล้วจบ