เลือกโมเดลและฮาร์ดแวร์ให้เหมาะกับเครื่อง

ภาพประกอบ: เลือกโมเดลและฮาร์ดแวร์ให้เหมาะกับเครื่อง

เครื่องมือ Local AI ในเว็บนี้ออกแบบมาสำหรับ Mac Apple Silicon ตั้งแต่ M1 ขึ้นไป และใช้ MLX เพื่อรันโมเดลบนชิป M-series โดยตรง สิ่งที่ต้องดูเป็นอันดับแรกไม่ใช่ความเร็วของชิป แต่คือ RAM ที่มีอยู่

ทำไม RAM ถึงสำคัญที่สุด

ก่อนตอบคำถาม โมเดลภาษาต้องโหลด weights เข้าหน่วยความจำก่อน ยิ่งมีพารามิเตอร์มาก (B หมายถึงพันล้าน) ก็ยิ่งใช้ RAM มากขึ้น บน Apple Silicon หน่วยความจำชุดเดียวถูกใช้ร่วมกันโดย CPU, GPU และ Neural Engine ดังนั้น RAM ของเครื่องจึงเป็นตัวกำหนดเพดานขนาดโมเดลที่รันได้จริง

Quantization คืออะไร ทำไมทุกเครื่องมือถึงใช้

โมเดลต้นฉบับมักเก็บค่าตัวเลขแบบ 16 หรือ 32 bit จึงมีขนาดใหญ่ Quantization คือการลดความละเอียดของตัวเลขเหล่านั้นลง เช่นเหลือ 4 bit ยอมให้ความแม่นยำลดลงเล็กน้อยเพื่อประหยัดหน่วยความจำอย่างมาก เครื่องมือในเว็บนี้จึงตั้งต้นด้วยโมเดล 4-bit quantized ซึ่งมักสังเกตได้จากชื่อที่มี 4bit หรือ MLX

ตารางเทียบ: เครื่องแบบไหน ใช้เครื่องมือตัวไหนได้

RAM ของเครื่อง โมเดลที่รันได้ เครื่องมือที่ใช้ได้
8GB Qwen3.5-2B-OptiQ-4bit (~3–4GB ตอนใช้งานจริง) ENDEAVOR AGENT LITE
16GB mlx-community/Qwen3.5-9B-4bit ENDEAVOR LOCAL AGENT TH ใช้งานได้ด้วย compact VLM — รองรับ image input/direct vision และเหมาะเมื่อ RAM จำกัด
24–32GB Qwen3-14B-MLX-4bit (default) Agent TH ใช้งาน text/tool calling ได้พร้อม headroom มากขึ้น; 14B configuration นี้ใช้ OCR fallback สำหรับภาพ
≥48GB Qwen3.6-35B-A3B-UD-MLX-4bit (high quality) Agent TH พร้อม direct vision และ reasoning/tool-calling headroom สูงสุดในสามตัวเลือก

จำง่าย ๆ: 16GB เริ่มใช้ LOCAL AGENT TH ได้ด้วย Qwen3.5-9B VLM; 24GB+ ใช้ Qwen3-14B ซึ่งยังเป็น fresh default ของโปรเจกต์; 48GB+ เหมาะกับ Qwen3.6-35B เมื่อต้องการ reasoning/tool calling ที่น่าเชื่อถือกว่าและ direct vision พร้อม headroom สูงขึ้น. ถ้ามีเพียง 8GB ให้เริ่มจาก LITE

MCP-RagMax และ MCP-RagDoc เป็น retrieval backends ไม่ใช่ chat model จึงไม่ควรผูกสเปกกับขนาด Qwen ในตารางนี้โดยตรง ทั้งสองใช้ embedding/retrieval runtime ของตัวเอง; MCP-RagDoc ยังสามารถเปิด semantic retrieval หรือ local vision OCR correction เป็น option แยกตามเครื่องได้

ขนาดโมเดลกับคุณภาพคำตอบ

โมเดลที่ใหญ่ขึ้นไม่ได้มีผลแค่ความสามารถในการตอบคำถาม แต่ช่วยเรื่อง tool calling โดยตรงด้วย Agent ต้องเลือกฟังก์ชันและส่ง argument ตามรูปแบบที่ระบบกำหนด โมเดลเล็กจึงมีโอกาสเลือก tool ผิดหรือส่งรูปแบบผิดได้มากกว่า

จากประสบการณ์ตรงของทีมพัฒนา ENDEAVOR:

  • 35B (high quality) — เรียก tool และ reasoning หลายขั้นได้แม่นยำกว่า เหมาะกับ workflow ซับซ้อน
  • 14B (default) — สมดุลสำหรับ text/tool calling; 24GB เป็นขั้นต่ำเชิงปฏิบัติ และ 32GB+ แนะนำ สำหรับรุ่นนี้
  • 9B VLM — ทำงานเป็น Agent และใช้ direct vision ได้บน 16GB แต่ reasoning/tool-calling headroom ต่ำกว่า 35B จึงเหมาะกับงานทั่วไปหรือเครื่องที่ RAM จำกัด
  • 7B/8B ลงมา — ไม่ใช่ target ของ Agent TH รุ่นปัจจุบัน เพราะ reliability ของ reasoning/tool-call ลดลงชัดเจน
  • 2B (LITE/RAG) — ออกแบบมาสำหรับงานที่ชัดเจนตรงไปตรงมา ไม่ใช่งานวิเคราะห์หลายชั้น — คำสั่งควรระบุเป้าหมายให้ชัด

เช็คสเปกเครื่องตัวเองก่อนเริ่ม

เปิด About This Mac จากเมนู Apple แล้วดูช่อง “Memory” หากไม่แน่ใจว่าเครื่องเป็น Apple Silicon หรือ Intel ให้ดูช่อง “Chip”; เครื่องที่ใช้ได้ต้องขึ้นต้นด้วย “Apple M” เพราะเครื่องมือในเว็บนี้ไม่รองรับ Intel Mac

อ่านต่อ

ความคิดเห็น

กำลังโหลดความคิดเห็น...