태국 드론 협회

สมัครสมาชิก

ทำไม Tesla ถึง “เห็นผี”? เจาะลึก AI กล้องล้วน Tesla Vision ที่วาดคนขึ้นมาเองจากรูปปั้น

ช่วงนี้มีคลิปไวรัลที่ทำเอาหลายคนขนลุก — จอกลางรถ Tesla จู่ ๆ ก็เรนเดอร์ภาพ “คน” ยืนเรียงกันรอบรถ ทั้งที่มองออกไปนอกกระจกแล้วไม่มีใครสักคน บางคลิปถ่ายในสุสานตอนกลางคืน เลยลือกันสนุกปากว่ารถ Tesla “เห็นผี” ได้ แต่คำตอบจริงไม่ได้อยู่ในโลกวิญญาณ — มันอยู่ในวิธีที่ AI กล้องล้วน ของ Tesla “มองเห็น” โลกต่างหาก

บทความนี้จะพาไล่ทีละขั้นแบบเทคนิคแต่อ่านง่าย ว่าทำไมระบบถึงวาดคนขึ้นมาเอง และทำไมมันถึง “ทำงานถูกต้องตามที่ออกแบบ” ทั้งที่ผลออกมาดูหลอน

🔎 ผลวินิจฉัย: FALSE POSITIVE (การตรวจจับลวง)
ไม่ใช่เรื่องผี แต่เป็นข้อจำกัดคลาสสิกของระบบกล้องล้วนที่ไม่มีเซ็นเซอร์ตัวอื่นคอยเช็กซ้ำ — เป็นเรื่องวิศวกรรมที่อธิบายได้ทุกขั้นตอน
PEDESTRIAN ×4
// สิ่งที่จอแสดง ≠ ภาพถ่ายจริง — มันคือฟิกเกอร์ที่ AI “เรนเดอร์” ขึ้นใหม่จากสิ่งที่มันคิดว่าเห็น

1) ภาพบนจอ Tesla ไม่ใช่ “กล้องสด”

Tesla รุ่นใหม่ใช้ระบบ “Tesla Vision” — กล้อง 8 ตัวรอบคัน โดย ตัดเรดาร์ (radar) และ LiDAR ออกทั้งหมด (Tesla ทยอยถอดเรดาร์ออกตั้งแต่ปี 2021) นั่นแปลว่าสิ่งที่คุณเห็นบนจอ ไม่ใช่วิดีโอจากกล้องตรง ๆ แต่เป็น “ภาพที่ AI ตีความเสร็จแล้ววาดขึ้นใหม่”

พูดให้เห็นภาพคือ จอรถไม่ได้ทำหน้าที่เหมือนกล้องวงจรปิดที่โชว์ภาพดิบ แต่ทำหน้าที่เหมือน “นักวาดการ์ตูน” ที่ฟังจาก AI ว่าเห็นอะไรบ้าง แล้ววาดตุ๊กตา 3 มิติแทนวัตถุแต่ละชิ้น จุดไหนที่ AI เข้าใจผิด ตุ๊กตาคนก็โผล่ขึ้นมาตรงนั้น

2) Pipeline 3 ขั้น: จากพิกเซลดิบ สู่ตุ๊กตา 3 มิติ

INPUT
8 กล้องรอบคัน
เก็บภาพ 360° เป็นพิกเซลดิบ ส่งเข้าระบบประมวลผล
PROCESS
Neural Network
จำแนกว่า “วัตถุนี้คือคน/รถ/สิ่งกีดขวาง?” + ประเมินตำแหน่ง 3 มิติ (Occupancy Network + BEV)
OUTPUT
เรนเดอร์ 3D
เอาผลที่ตีความได้มา “วาดเป็นการ์ตูน 3 มิติ” บนจอ — จุดที่ผิดพลาดกลายเป็นรูปคนเต็มตัว

หัวใจสำคัญที่หลายคนเข้าใจผิดคือ — โมเดลไม่ได้ “เห็นภาพ” แบบที่ตาเราเห็น มันแปลงพิกเซลเป็นตัวเลขมหาศาล แล้วทำนายออกมาเป็น ป้ายชื่อคลาส (class) + ค่าความมั่นใจ (confidence) เช่น “ตำแหน่งนี้ = pedestrian, confidence 0.92” เท่านั้นเอง มันไม่มีแนวคิดว่า “มีชีวิต” หรือ “ไม่มีชีวิต” อยู่ในหัวเลย

3) 4 เหตุผลที่ AI วาด “คน” ขึ้นมาเอง

  1. มันจับ “รูปทรงคน” ไม่ใช่ “คนเป็น” — โมเดลถูกฝึกให้ตอบว่า รูปทรงนี้คือคนไหม ไม่ใช่ นี่คือสิ่งมีชีวิตไหม อะไรก็ตามที่มีสัดส่วนหัว–ลำตัว–แขนแบบมนุษย์ จึงถูกจัดเป็น “คนเดินถนน” ทันที (shape classification)
  2. ไม่มี Liveness Detection — รถไม่มีเซ็นเซอร์วัดชีพจร การหายใจ หรือความร้อนร่างกาย ในสายตาของกล้องล้วน “หินสลักรูปคน” กับ “คนจริง” จึงให้ภาพเงา (silhouette) เหมือนกันเป๊ะ
  3. วิศวกร “ตั้งใจ” ให้มันระวังเกิน — ตั้งค่าให้ “เตือนเกินดีกว่าพลาด” เพราะพลาดคนจริง = อาจชนคนตาย ส่วนเตือนลวง = แค่จอโชว์คนเกินมา ระบบจึงไวต่อทุกเงาคล้ายคน (recall > precision)
  4. ตัด LiDAR/Radar = ไม่มีตัวเช็กซ้ำ — ถ้ามีเรดาร์ มันจะช่วยบอกว่า “นี่ก้อนวัตถุแข็งที่ไม่ขยับ” แต่กล้องล้วนไม่มีข้อมูลระยะ/วัสดุมายืนยัน เลยขาด sensor redundancy

4) เจาะลึกอีกนิด: ทำไม “ระวังเกิน” ถึงเป็นการออกแบบที่ถูกต้อง

ในโลกของ AI ความปลอดภัย มีสองคำที่ต้องชั่งน้ำหนักเสมอ: Recall (จับคนจริงได้ครบแค่ไหน) กับ Precision (ที่บอกว่าเป็นคน เป็นคนจริงแค่ไหน) — สองค่านี้มัก “แลกกัน” สำหรับรถยนต์ การ “พลาดคนจริง 1 ครั้ง” มีต้นทุนเป็นชีวิต ส่วน “เตือนลวง 100 ครั้ง” แค่จอโชว์ตุ๊กตาเกินมา วิศวกรจึงตั้ง confidence threshold ให้ต่ำไว้ก่อน ผลคือระบบ “ขี้ระวัง” โดยตั้งใจ

นี่ยังเป็นญาติกับปัญหาเก่าที่เรียกว่า “phantom braking” (รถเบรกเองทั้งที่ไม่มีอะไร) ที่เคยเป็นข่าวหลัง Tesla ถอดเรดาร์ — ต้นตอเดียวกันคือระบบ “เห็น” สิ่งที่ไม่มีอยู่จริง เพราะเลือกจะระแวงไว้ก่อน

5) เคสเด็ด: ร้านรูปปั้น กลางวันแดดจ้า

มีคลิปที่รถวิ่งผ่านร้านขายรูปปั้นเทพเจ้าจีน ตอนกลางวันแสงสว่างเต็มที่ — จอก็ยังโชว์คนยืนเรียงเป็นแถว เคสนี้ ตัดข้อแก้ตัวเรื่อง “แสงน้อย/ภาพมั่ว” ทิ้งทั้งหมด เหลือความจริงข้อเดียว: AI แยก “รูปทรงคน” ออกได้ แต่แยก “คนเป็น vs รูปปั้น” ไม่ได้


รูปปั้นคนยืน (หิน)




สิ่งที่ AI “เห็น” = คน


ปัจจัย เคสสุสาน · กลางคืน เคสรูปปั้น · กลางวัน
สภาพแสง น้อย → noise เยอะ สว่างเต็มที่ → ภาพคมชัด
รูปทรงวัตถุ หลุมศพ (กำกวม คล้ายคน) รูปปั้นคน (เหมือนคนเป๊ะ)
ความมั่นใจ AI แกว่ง → ปรากฏ-หาย สูง นิ่ง ชัด
// คำตอบจริง
AI จำแนก “รูปทรงมนุษย์” ได้แม่นยำ แต่มันแยก คนเป็น กับ รูปปั้นคน ไม่ออก เพราะมันไม่เคยถูกออกแบบมาให้แยกตรงนั้นตั้งแต่แรก และไม่มีเซ็นเซอร์ตัวอื่นมาช่วยยืนยัน นี่ไม่ใช่ “บั๊กจากแสงน้อย” แต่คือระบบที่ทำงาน ถูกต้องตามที่ออกแบบ จนวัตถุรูปคนทุกชิ้นกลายเป็นคนหมด

6) แล้วแก้ได้ไหม? — มุมวิศวกรรม

  • Sensor fusion: เพิ่มเรดาร์ / LiDAR กลับมาเป็น “ความเห็นที่สอง” ยืนยันระยะและความแข็งของวัตถุ
  • กล้องความร้อน (Thermal/IR): คนมีอุณหภูมิร่างกาย รูปปั้นหินไม่มี — ตัวแยก “มีชีวิต” ที่ตรงจุดที่สุด
  • Temporal & semantic cues: ใช้ข้อมูลข้ามเฟรม (คนขยับ–รูปปั้นนิ่ง) และบริบท (รูปปั้นมักตั้งบนแท่น เรียงแถว หน้าร้าน) มาช่วยตัดสิน

แต่ Tesla เลือกเดิมพันกับเส้นทาง “กล้องล้วน + โมเดลขนาดใหญ่” ด้วยเหตุผลด้านต้นทุนและการสเกลทั่วโลก ปรากฏการณ์ “เห็นผี” จึงเป็นผลพลอยได้ของการตัดสินใจเชิงสถาปัตยกรรมนั้นเอง

결론

น้องไม่ได้มีสัมผัสที่ 6 — น้องแค่ขี้ระวัง 😄 สิ่งที่เกิดขึ้นคือข้อจำกัดคลาสสิกของระบบกล้องล้วนที่ไม่มีเซ็นเซอร์ตัวอื่นคอยเช็กซ้ำ ไม่ใช่เรื่องลี้ลับ แต่เป็นเรื่อง computer vision ที่อธิบายได้ครบทุกขั้นตอน — และเป็นบทเรียนชั้นดีว่า “AI เห็นโลกไม่เหมือนเรา” เสมอ

🎬 ดูคลิปกัน

คลิป: จอ Tesla เรนเดอร์ “คน” ขณะวิ่งผ่านร้านรูปปั้น (โฮสต์บนเซิร์ฟเวอร์ของเราเอง เล่นได้แน่นอน)

🙏 เครดิตวิดีโอ: ซ้อเปา – เรื่องนี้ต้องใส่ใจ (Facebook Reel)

Teerachai Lertpanikul นักเขียนและผู้เชี่ยวชาญด้านเทคโนโลยีโดรน
เขียนโดย
Teerachai Lertpanikul

นักเขียนและผู้เชี่ยวชาญด้านเทคโนโลยีโดรน มีประสบการณ์เกี่ยวกับการใช้งานอากาศยานไร้คนขับ, AI, Robotics มุ่งนำเสนอข้อมูลที่ถูกต้อง เข้าใจง่าย และนำไปใช้งานได้จริง

위로 스크롤