
NVIDIA เปิดตัว Nemotron 3.5 Lightning โมเดล open-weight 30B เน้น AI Agent โดยเฉพาะ
วันที่ 11 สิงหาคม 2026 NVIDIA เปิดตัว Nemotron 3.5 Lightning โมเดลภาษา open-weight ขนาด 30B สำหรับ AI agent ที่ต้องทำงานต่อเนื่องนาน ๆ พร้อมให้ใช้ผ่าน Ollama, LM Studio, llama.cpp และ Unsloth
ข้อมูลจำเพาะ
- ผู้พัฒนา: NVIDIA
- ขนาดพารามิเตอร์: 30,000 ล้าน (total) แต่ใช้จริงแค่ 3,000 ล้าน active parameters ต่อ token — นี่คือโครงสร้าง Mixture-of-Experts (MoE) ที่เลือกใช้แค่บาง “expert” ในแต่ละครั้ง ไม่ใช้ทั้งโมเดลพร้อมกัน
- สถาปัตยกรรม: Hybrid — ผสม Mamba-2 + MoE + Attention เข้าด้วยกัน ไม่ใช่ Transformer ล้วนแบบโมเดลทั่วไป
- Context window: 1 ล้าน token
- สัญญาอนุญาต: OpenMDW-1.1 (permissive) — เปิดทั้ง weight, training data, และสูตรการเทรน ใช้เชิงพาณิชย์ได้
ทำไมถึงเร็วกว่าโมเดลขนาดเทียบเท่า
จุดที่ NVIDIA เน้นคือความเร็ว โดยระบุว่าเร็วกว่าโมเดลเปิดขนาดใกล้เคียงได้ถึง 4 เท่า และลดเวลาที่ใช้ทำงานจนจบได้ 30% เบื้องหลังคือ speculative decoding สองรูปแบบที่เทรนมาคู่กับโมเดล:
- MTP (Multi-Token Prediction) — เทรนให้โมเดลทายหลาย token ล่วงหน้าในครั้งเดียว เหมาะกับงานที่มีคนใช้พร้อมกันเยอะ
- DFlash / DSpark — ตัว “draft model” แยกต่างหากที่ช่วยร่างคำตอบคร่าวๆ ให้โมเดลหลักตรวจทานแทนที่จะสร้างทีละ token เอง เหมาะกับงานที่ใช้คนเดียว/เครื่อง edge อย่าง DGX Spark
ออกแบบมาสำหรับ agent โดยเฉพาะ ไม่ใช่แชทบอททั่วไป
แทนที่จะเน้นงานสนทนาทั่วไป NVIDIA วาง Nemotron 3.5 Lightning ไว้สำหรับ agentic tasks เช่น อ่านไฟล์ เรียก tool จัดลำดับผลลัพธ์ และลองใหม่เมื่องานไม่สำเร็จ ตัวอย่างที่ยกมามีดังนี้:
| กลุ่มงาน | ตัวอย่าง |
|---|---|
| ผู้ช่วยส่วนตัว | จัดการอีเมล ปฏิทิน การจองต่างๆ ทำงานบนเครื่องทั้งหมด |
| Coding agent | ทดสอบโค้ด ค้นหาในฐานโค้ด ปรับโครงสร้างโค้ด |
| Cybersecurity | วิเคราะห์แจ้งเตือน จำแนกเหตุการณ์ ค้นข้อมูลจาก log |
รันได้บนฮาร์ดแวร์หลากหลายของ NVIDIA เอง — RTX PCs, RTX PRO workstations, DGX Spark, DGX Station, ไปจนถึง Jetson และ GeForce RTX 5090 — โดยข้อมูลทั้งหมดประมวลผลบนเครื่องผู้ใช้ ไม่ส่งออกไปคลาวด์
ผลทดสอบที่ NVIDIA เผยแพร่ (เวอร์ชัน BF16): SWE-bench Verified 51.56, GPQA Diamond 75.44, MMLU Pro 81.94
ทำไมเรื่องนี้เกี่ยวกับ HALO ENDEAVOR
ข่าวนี้ต่อเนื่องจาก Meta Muse Glimmer และสะท้อนทิศทางเดียวกัน: โมเดล open-weight ที่ทำงานแบบ agent ได้จริงบนเครื่องผู้ใช้ ไม่ได้เป็นเพียงแชทบอท
จุดที่ตรงกับหลักการของเครื่องมือในเว็บนี้ (เช่น ENDEAVOR LOCAL AGENT TH ที่ใช้ ReAct loop ผ่าน LangGraph) มากที่สุดคือแนวคิด “โค้ดต้องคุมพฤติกรรม agent ไม่ใช่หวังให้โมเดลฉลาดพอเอง” — Nemotron 3.5 Lightning เลือกใช้ MoE บีบ active parameter ให้เล็กลงเพื่อความเร็ว บวกโครงสร้าง MTP/DFlash ที่ออกแบบมาเพื่องาน agent โดยเฉพาะ ไม่ใช่โมเดลอเนกประสงค์ทั่วไปที่เอามาทำ agent ทีหลัง
ข้อต่างสำคัญคือฮาร์ดแวร์: Nemotron 3.5 Lightning ผูกกับ ecosystem ของ NVIDIA (ต้องมี GPU ของ NVIDIA) ส่วนเครื่องมือทั้งหมดใน HALO ENDEAVOR optimize เฉพาะ Mac Apple Silicon ผ่าน MLX — คนละ ecosystem แต่ยืนยันทิศทางเดียวกันจากทั้งสองค่ายใหญ่: agent ที่ทำงานได้จริงต้องรันบนเครื่องผู้ใช้เอง ไม่ใช่พึ่งพา cloud API
ความคิดเห็น
กำลังโหลดความคิดเห็น...