Drone Association Thailand

สมัครสมาชิก☰

14 กันยายน 2026

NVIDIA TensorRT Model Connect
AI Server & Hardware

NVIDIA TensorRT Model Connect แปลง Hugging Face checkpoint สู่ C++ inference ใน 2 คำสั่ง

การดาวน์โหลด checkpoint จาก Hugging Face เป็นเรื่องง่าย แต่การนำไปฝังในบริการ C++ หุ่นยนต์ หรืออุปกรณ์ปลายทางมักต้องผ่านการ export หลายชั้นและเขียนโค้ดเฉพาะโมเดล NVIDIA เปิด public preview ของ TensorRT Model Connect (TRTMC) โครงการ open source ที่พาโมเดลที่รองรับจาก Hugging Face หรือไฟล์ในเครื่องไปสู่ TensorRT inference แบบ native C++ ได้ใน 2 คำสั่ง โดยไม่ต้องแปลงผ่าน ONNX ก่อน ภาพ:

NVIDIA TensorRT Model Connect แปลง Hugging Face checkpoint สู่ C++ inference ใน 2 คำสั่ง Read Post »

Perplexity Lily inference engine บน Apple Silicon
AI Server & Hardware

Perplexity เปิดซอร์ส Lily เอนจิน Rust และ Metal สำหรับรัน AI บน Apple Silicon

runtime ที่รองรับโมเดลจำนวนมากให้ความยืดหยุ่น แต่ต้องรักษาโค้ดให้ใช้ซ้ำข้ามสถาปัตยกรรม Perplexity เลือกอีกทางด้วย Lily inference engine ที่จงใจปรับเฉพาะโมเดล Qwen3.6-35B-A3B บน Apple silicon เพื่อรีดความเร็วจากโครงสร้างชิปและ unified memory โดยตรง โครงการนี้เป็นกลไก local inference เบื้องหลัง Hybrid Compute ของ Perplexity Computer และถูกเปิดซอร์สให้ทดลองผ่าน repository pplx-garden ภาพ: Perplexity ตัวระบบทำงานใน process เดียว ชั้น Rust โหลด checkpoint และควบคุมวงจรสร้างข้อความ ส่วน

Perplexity เปิดซอร์ส Lily เอนจิน Rust และ Metal สำหรับรัน AI บน Apple Silicon Read Post »

Perplexity Hybrid Compute on Mac
AI Server & Hardware

Perplexity Hybrid Compute แบ่งงาน AI ระหว่างคลาวด์กับโมเดลใน Mac

AI agent จะมีประโยชน์มากขึ้นเมื่ออ่านเอกสารลูกค้า ไฟล์ข้อตกลง และข้อมูลภายในได้ แต่ข้อมูลเหล่านี้ก็เป็นสิ่งที่องค์กรไม่อยากส่งขึ้นคลาวด์ Perplexity จึงเปิด Hybrid Compute on Mac ให้ภารกิจเดียวแบ่งงานระหว่างโมเดลขนาดใหญ่บนคลาวด์กับโมเดลขนาดเล็กบน Mac โดยมี privacy gate ในเครื่องตัดสินว่าข้อมูลส่วนใดออกจากอุปกรณ์ได้ ภาพ: Perplexity ระบบเปิดใช้กับสมาชิก Pro, Max และ Enterprise บน Mac ที่ใช้ Apple silicon, ระบบ macOS 15 ขึ้นไป และ unified memory อย่างน้อย 24GB โดยแนะนำ

Perplexity Hybrid Compute แบ่งงาน AI ระหว่างคลาวด์กับโมเดลใน Mac Read Post »

Anthropic Model Hardware Standard
AI Server & Hardware

Anthropic เปิดตัว MHS มาตรฐานกลางให้ AI agent ควบคุมอุปกรณ์จริงอย่างปลอดภัย

การให้ AI ช่วยตอบคำถามเป็นเรื่องหนึ่ง แต่การปล่อยให้ AI ขยับแขนกล ปรับเลเซอร์ หรือสั่งเครื่องมือในห้องทดลองเป็นอีกเรื่อง เพราะความผิดพลาดไม่ได้จบแค่คำตอบผิดบนหน้าจอ แต่อาจทำให้อุปกรณ์เสียหายหรือกระทบความปลอดภัยได้ Anthropic จึงเปิดโครงการวิจัย Model Hardware Standard (MHS) เพื่อสร้างภาษากลางระหว่าง AI agent กับอุปกรณ์จริง พร้อมกำหนดขอบเขตว่าระบบอ่านค่าอะไร ปรับอะไรได้ และต้องหยุดตรงไหน ภาพ: Anthropic เป้าหมายของ MHS ไม่ใช่สร้างหุ่นยนต์รุ่นใหม่ แต่แก้ปัญหาที่พบในห้องแล็บและสายการผลิตจำนวนมาก: เครื่องมือจากผู้ผลิตคนละรายมีอินเทอร์เฟซไม่เหมือนกัน ทีมงานจึงต้องเขียนซอฟต์แวร์เชื่อมต่อเป็นรายคู่ งานติดตั้งที่ Anthropic ระบุว่าเคยกินเวลาหลายสัปดาห์ถึงหลายเดือน อาจลดเหลือระดับชั่วโมงหรือนาทีเมื่ออุปกรณ์พูดผ่านมาตรฐานเดียวกัน Driver กลางทำให้ agent รู้จักเครื่องมือ แกนหลักของ

Anthropic เปิดตัว MHS มาตรฐานกลางให้ AI agent ควบคุมอุปกรณ์จริงอย่างปลอดภัย Read Post »

LTX-2.5 world model สำหรับผลิตวิดีโอ
AI Server & Hardware

LTX-2.5 ยกชุดผลิตวิดีโอ AI มาไว้บนโต๊ะ เปิดเวทและเร่งความเร็วด้วย NVIDIA

การสร้างวิดีโอด้วย AI กำลังขยับจากบริการคลาวด์ที่คิดค่าบริการตามจำนวนครั้ง มาสู่เวิร์กสเตชันที่ผู้สร้างควบคุมเอง Lightricks เปิดตัว LTX-2.5 โมเดลแบบ open weights สำหรับสร้างวิดีโอ งานเรียลไทม์ และ physical AI โดยปรับให้ทำงานกับ NVIDIA RTX และ NVIDIA DGX Spark ได้ เป้าหมายคือย้ายขั้นตอนสร้าง ทดลอง และปรับแต่งงานมาอยู่บนเครื่องเดียว โดยไม่ต้องส่งทรัพย์สินทางปัญญาออกนอกระบบ ภาพ: Lightricks จุดขายไม่ได้อยู่แค่ “รันในเครื่อง” แต่เป็นการทำวิดีโอหลายช็อตให้ต่อเนื่องในครั้งเดียว รุ่นก่อนของโมเดลเปิดมักรักษาหน้าตาตัวละคร แสง หรือสไตล์ข้ามช็อตได้ยาก LTX-2.5 เพิ่ม native multishot generation

LTX-2.5 ยกชุดผลิตวิดีโอ AI มาไว้บนโต๊ะ เปิดเวทและเร่งความเร็วด้วย NVIDIA Read Post »

Liquid AI Pipette ชุดทดสอบโมเดลบนอุปกรณ์
AI Server & Hardware

Liquid AI เปิด Pipette วัดโมเดล Quantization Runtime และฮาร์ดแวร์ในชุดเดียว

คะแนนบน model card บอกได้ว่าโมเดลเก่งเพียงใดภายใต้สภาพทดสอบหนึ่ง แต่ไม่ได้ตอบว่าเมื่อลดความละเอียดน้ำหนักแล้วนำไปรันบนโทรศัพท์หรือโน้ตบุ๊ก ผู้ใช้จะรอนานแค่ไหน เครื่องจะกินหน่วยความจำเท่าไร และคุณภาพจะตกลงมากน้อยเพียงใด Liquid AI จึงเปิดซอร์ส Pipette ชุด benchmark ที่ถือว่า “ระบบใช้งานจริง” คือผลรวมของโมเดล วิธี quantization, runtime และอุปกรณ์ ไม่ใช่ดูชื่อโมเดลแยกเดี่ยว ภาพ: Liquid AI โครงการนี้พัฒนาร่วมกับ Artificial Analysis ซึ่งทำหน้าที่ตรวจสอบวิธีวัดอย่างอิสระ ชุดข้อมูลเปิดตัวครอบคลุมตัวชี้วัดประสิทธิภาพบนอุปกรณ์ 5 รายการ มากกว่า 1,000 configurations จากโมเดลมากกว่า 30 รุ่น มี runtime

Liquid AI เปิด Pipette วัดโมเดล Quantization Runtime และฮาร์ดแวร์ในชุดเดียว Read Post »

LFM2.5-DSpark speculative decoding
AI Server & Hardware

LFM2.5-DSpark ใช้โมเดลร่างเร่งการ Decode สูงสุด 3.18 เท่า โดยคำตอบไม่เปลี่ยน

เมื่อรันโมเดลภาษาในเครื่อง เวลาที่ผู้ใช้รอไม่ได้ขึ้นอยู่กับความเก่งของโมเดลเท่านั้น แต่ยังขึ้นกับความเร็วในการสร้าง token ทีละคำ Liquid AI เปิดตัว checkpoint ชุด LFM2.5-DSpark เพื่อเพิ่มเส้นทาง speculative decoding ให้โมเดล LFM2.5 สามรุ่น โดยรายงานความเร็วสูงสุด 3.18 เท่า บน NVIDIA H100 และ 2.87 เท่า บน MacBook Pro ชิป M4 Max จุดสำคัญคือในโหมด greedy decoding ลำดับคำตอบที่ปล่อยออกมายังคงเหมือนการรันโมเดลหลักเพียงตัวเดียว ภาพ: Liquid AI โมเดลที่รองรับประกอบด้วย

LFM2.5-DSpark ใช้โมเดลร่างเร่งการ Decode สูงสุด 3.18 เท่า โดยคำตอบไม่เปลี่ยน Read Post »

ภาพ: OpenAI
AI Article

GPT-6 Astra: โมเดลคอมพิวเตอร์ยูสที่คิดยาวขึ้น และถูกล็อกเข้มขึ้น

OpenAI เปิดตัว GPT-6 Astra ในบทบาทที่ต่างจากแชตโมเดลทั่วไปค่อนข้างชัด บริษัทวางมันเป็นระบบ computer-use มากกว่าการตอบข้อความลอย ๆ คือให้มันทำงานกับเบราว์เซอร์, สเปรดชีต, เดสก์ท็อปแอป และเทอร์มินัลเหมือนคนใช้งานเครื่องจริง จุดขายจึงไม่ใช่แค่ “ตอบเก่ง” แต่คือ “ทำงานให้จบ” ภาพ: OpenAI สิ่งที่สำคัญสำหรับนักพัฒนาคือ Astra เปลี่ยนวิธีเก็บบริบท จากเดิมที่ใช้การ compaction แล้วทิ้งรายละเอียดบางส่วนเมื่อ context เต็ม ไปเป็นการเก็บโน้ตข้ามหน้าต่าง context และย้อนค้นจากข้อความเก่าและ tool output ได้ ซึ่งเหมาะกับงานเอเจนต์ที่ต้องจำเหตุผลว่าเคยลองอะไรไปแล้ว ทำไมจึงไม่ผ่าน และเงื่อนไขต้นทางคืออะไร ใช้งานได้ แต่ไม่ใช่ทุกคน ในเชิงการ deploy

GPT-6 Astra: โมเดลคอมพิวเตอร์ยูสที่คิดยาวขึ้น และถูกล็อกเข้มขึ้น Read Post »

ภาพ: Z.ai
AI Article

GLM-5.3-Flash กับ Qwen3.8-Flash-Next: สองค่ายจีนที่มาบรรจบกันแบบไม่ได้นัดหมาย

สองโมเดลใหญ่จากจีนเปิดตัวไล่เลี่ยกันในสัปดาห์เดียว แต่สิ่งที่น่าสนใจกว่าความเร็วในการปล่อยคือ โครงสร้างภายในของมันกลับไปลงเอยในทิศทางคล้ายกันอย่างน่าประหลาดใจ Z.ai ออก GLM-5.3-Flash ขนาด 320B พารามิเตอร์ พร้อม active parameters 18B ส่วนฝั่ง Alibaba Qwen ส่ง Qwen3.8-Flash-Next ขนาด 125B พารามิเตอร์ โดยมี active parameters 6B จุดร่วมไม่ได้เกิดจากการคุยกันล่วงหน้า แต่เหมือนสองทีมวิจัยมองปัญหาเดียวกันแล้วเลือกคำตอบคล้ายกันเกินคาด ภาพ: Z.ai แกนของเรื่องนี้อยู่ที่การออกแบบให้ “ประหยัดแต่ยังฉลาด” ทั้งสองรุ่นใช้สัดส่วน 3:1 ระหว่างชั้น attention แบบเชิงเส้นกับแบบเต็ม, ใช้ตัวคัดกรองบริบทที่ถูกบีบก่อนคัดเลือก และขยาย residual stream

GLM-5.3-Flash กับ Qwen3.8-Flash-Next: สองค่ายจีนที่มาบรรจบกันแบบไม่ได้นัดหมาย Read Post »

ภาพ: Google DeepMind
AI Article

Gemini 3.8 Flash และ Flash Cyber: โมเดลแกนเดียว แต่เปิดใช้คนละทาง

Google DeepMind เปิดตัว Gemini 3.8 Flash และ Gemini 3.8 Flash Cyber ในฐานะโมเดลแกนเดียวที่ถูกห่อด้วยเงื่อนไขการเข้าถึงต่างกัน ไม่ใช่สถาปัตยกรรมคนละชุด ความต่างสำคัญจึงไม่ใช่ว่าโมเดล “คนละตัว” แต่คือใครได้ใช้ และเอาไปใช้แบบไหน ภาพ: Google DeepMind รุ่นหลักอย่าง Gemini 3.8 Flash เปิดให้ใช้งานทั่วไปผ่าน Gemini API, Google AI Studio, Antigravity, Android Studio และ Gemini Enterprise ส่วน Flash Cyber ไม่ได้เปิดกว้างแบบนั้น

Gemini 3.8 Flash และ Flash Cyber: โมเดลแกนเดียว แต่เปิดใช้คนละทาง Read Post »

Scroll to Top