ช่วงนี้มีคลิปไวรัลที่ทำเอาหลายคนขนลุก — จอกลางรถ Tesla จู่ ๆ ก็เรนเดอร์ภาพ “คน” ยืนเรียงกันรอบรถ ทั้งที่มองออกไปนอกกระจกแล้วไม่มีใครสักคน บางคลิปถ่ายในสุสานตอนกลางคืน เลยลือกันสนุกปากว่ารถ Tesla “เห็นผี” ได้ แต่คำตอบจริงไม่ได้อยู่ในโลกวิญญาณ — มันอยู่ในวิธีที่ AI กล้องล้วน ของ Tesla “มองเห็น” โลกต่างหาก
บทความนี้จะพาไล่ทีละขั้นแบบเทคนิคแต่อ่านง่าย ว่าทำไมระบบถึงวาดคนขึ้นมาเอง และทำไมมันถึง “ทำงานถูกต้องตามที่ออกแบบ” ทั้งที่ผลออกมาดูหลอน
ไม่ใช่เรื่องผี แต่เป็นข้อจำกัดคลาสสิกของระบบกล้องล้วนที่ไม่มีเซ็นเซอร์ตัวอื่นคอยเช็กซ้ำ — เป็นเรื่องวิศวกรรมที่อธิบายได้ทุกขั้นตอน
1) ภาพบนจอ Tesla ไม่ใช่ “กล้องสด”
Tesla รุ่นใหม่ใช้ระบบ “Tesla Vision” — กล้อง 8 ตัวรอบคัน โดย ตัดเรดาร์ (radar) และ LiDAR ออกทั้งหมด (Tesla ทยอยถอดเรดาร์ออกตั้งแต่ปี 2021) นั่นแปลว่าสิ่งที่คุณเห็นบนจอ ไม่ใช่วิดีโอจากกล้องตรง ๆ แต่เป็น “ภาพที่ AI ตีความเสร็จแล้ววาดขึ้นใหม่”
พูดให้เห็นภาพคือ จอรถไม่ได้ทำหน้าที่เหมือนกล้องวงจรปิดที่โชว์ภาพดิบ แต่ทำหน้าที่เหมือน “นักวาดการ์ตูน” ที่ฟังจาก AI ว่าเห็นอะไรบ้าง แล้ววาดตุ๊กตา 3 มิติแทนวัตถุแต่ละชิ้น จุดไหนที่ AI เข้าใจผิด ตุ๊กตาคนก็โผล่ขึ้นมาตรงนั้น
2) Pipeline 3 ขั้น: จากพิกเซลดิบ สู่ตุ๊กตา 3 มิติ
หัวใจสำคัญที่หลายคนเข้าใจผิดคือ — โมเดลไม่ได้ “เห็นภาพ” แบบที่ตาเราเห็น มันแปลงพิกเซลเป็นตัวเลขมหาศาล แล้วทำนายออกมาเป็น ป้ายชื่อคลาส (class) + ค่าความมั่นใจ (confidence) เช่น “ตำแหน่งนี้ = pedestrian, confidence 0.92” เท่านั้นเอง มันไม่มีแนวคิดว่า “มีชีวิต” หรือ “ไม่มีชีวิต” อยู่ในหัวเลย
3) 4 เหตุผลที่ AI วาด “คน” ขึ้นมาเอง
- มันจับ “รูปทรงคน” ไม่ใช่ “คนเป็น” — โมเดลถูกฝึกให้ตอบว่า รูปทรงนี้คือคนไหม ไม่ใช่ นี่คือสิ่งมีชีวิตไหม อะไรก็ตามที่มีสัดส่วนหัว–ลำตัว–แขนแบบมนุษย์ จึงถูกจัดเป็น “คนเดินถนน” ทันที (shape classification)
- ไม่มี Liveness Detection — รถไม่มีเซ็นเซอร์วัดชีพจร การหายใจ หรือความร้อนร่างกาย ในสายตาของกล้องล้วน “หินสลักรูปคน” กับ “คนจริง” จึงให้ภาพเงา (silhouette) เหมือนกันเป๊ะ
- วิศวกร “ตั้งใจ” ให้มันระวังเกิน — ตั้งค่าให้ “เตือนเกินดีกว่าพลาด” เพราะพลาดคนจริง = อาจชนคนตาย ส่วนเตือนลวง = แค่จอโชว์คนเกินมา ระบบจึงไวต่อทุกเงาคล้ายคน (recall > precision)
- ตัด LiDAR/Radar = ไม่มีตัวเช็กซ้ำ — ถ้ามีเรดาร์ มันจะช่วยบอกว่า “นี่ก้อนวัตถุแข็งที่ไม่ขยับ” แต่กล้องล้วนไม่มีข้อมูลระยะ/วัสดุมายืนยัน เลยขาด sensor redundancy
4) เจาะลึกอีกนิด: ทำไม “ระวังเกิน” ถึงเป็นการออกแบบที่ถูกต้อง
ในโลกของ AI ความปลอดภัย มีสองคำที่ต้องชั่งน้ำหนักเสมอ: Recall (จับคนจริงได้ครบแค่ไหน) กับ Precision (ที่บอกว่าเป็นคน เป็นคนจริงแค่ไหน) — สองค่านี้มัก “แลกกัน” สำหรับรถยนต์ การ “พลาดคนจริง 1 ครั้ง” มีต้นทุนเป็นชีวิต ส่วน “เตือนลวง 100 ครั้ง” แค่จอโชว์ตุ๊กตาเกินมา วิศวกรจึงตั้ง confidence threshold ให้ต่ำไว้ก่อน ผลคือระบบ “ขี้ระวัง” โดยตั้งใจ
นี่ยังเป็นญาติกับปัญหาเก่าที่เรียกว่า “phantom braking” (รถเบรกเองทั้งที่ไม่มีอะไร) ที่เคยเป็นข่าวหลัง Tesla ถอดเรดาร์ — ต้นตอเดียวกันคือระบบ “เห็น” สิ่งที่ไม่มีอยู่จริง เพราะเลือกจะระแวงไว้ก่อน
5) เคสเด็ด: ร้านรูปปั้น กลางวันแดดจ้า
มีคลิปที่รถวิ่งผ่านร้านขายรูปปั้นเทพเจ้าจีน ตอนกลางวันแสงสว่างเต็มที่ — จอก็ยังโชว์คนยืนเรียงเป็นแถว เคสนี้ ตัดข้อแก้ตัวเรื่อง “แสงน้อย/ภาพมั่ว” ทิ้งทั้งหมด เหลือความจริงข้อเดียว: AI แยก “รูปทรงคน” ออกได้ แต่แยก “คนเป็น vs รูปปั้น” ไม่ได้
≈
| ปัจจัย | เคสสุสาน · กลางคืน | เคสรูปปั้น · กลางวัน |
|---|---|---|
| สภาพแสง | น้อย → noise เยอะ | สว่างเต็มที่ → ภาพคมชัด |
| รูปทรงวัตถุ | หลุมศพ (กำกวม คล้ายคน) | รูปปั้นคน (เหมือนคนเป๊ะ) |
| ความมั่นใจ AI | แกว่ง → ปรากฏ-หาย | สูง นิ่ง ชัด |
AI จำแนก “รูปทรงมนุษย์” ได้แม่นยำ แต่มันแยก คนเป็น With รูปปั้นคน ไม่ออก เพราะมันไม่เคยถูกออกแบบมาให้แยกตรงนั้นตั้งแต่แรก และไม่มีเซ็นเซอร์ตัวอื่นมาช่วยยืนยัน นี่ไม่ใช่ “บั๊กจากแสงน้อย” แต่คือระบบที่ทำงาน ถูกต้องตามที่ออกแบบ จนวัตถุรูปคนทุกชิ้นกลายเป็นคนหมด
6) แล้วแก้ได้ไหม? — มุมวิศวกรรม
- Sensor fusion: เพิ่มเรดาร์ / LiDAR กลับมาเป็น “ความเห็นที่สอง” ยืนยันระยะและความแข็งของวัตถุ
- กล้องความร้อน (Thermal/IR): คนมีอุณหภูมิร่างกาย รูปปั้นหินไม่มี — ตัวแยก “มีชีวิต” ที่ตรงจุดที่สุด
- Temporal & semantic cues: ใช้ข้อมูลข้ามเฟรม (คนขยับ–รูปปั้นนิ่ง) และบริบท (รูปปั้นมักตั้งบนแท่น เรียงแถว หน้าร้าน) มาช่วยตัดสิน
แต่ Tesla เลือกเดิมพันกับเส้นทาง “กล้องล้วน + โมเดลขนาดใหญ่” ด้วยเหตุผลด้านต้นทุนและการสเกลทั่วโลก ปรากฏการณ์ “เห็นผี” จึงเป็นผลพลอยได้ของการตัดสินใจเชิงสถาปัตยกรรมนั้นเอง
Summary
น้องไม่ได้มีสัมผัสที่ 6 — น้องแค่ขี้ระวัง 😄 สิ่งที่เกิดขึ้นคือข้อจำกัดคลาสสิกของระบบกล้องล้วนที่ไม่มีเซ็นเซอร์ตัวอื่นคอยเช็กซ้ำ ไม่ใช่เรื่องลี้ลับ แต่เป็นเรื่อง computer vision ที่อธิบายได้ครบทุกขั้นตอน — และเป็นบทเรียนชั้นดีว่า “AI เห็นโลกไม่เหมือนเรา” เสมอ
🎬 ดูคลิปกัน
🙏 เครดิตวิดีโอ: ซ้อเปา – เรื่องนี้ต้องใส่ใจ (Facebook Reel)
