MCP-RagDoc
Document RAG MCP แบบ agent-agnostic สำหรับ Word/PDF/Office และเอกสารสแกน เก็บดัชนีใน SQLite, ใช้ FTS5/BM25 + OCR fuzzy + optional MiniLM และรักษา source path/page ให้ตรวจย้อนกลับได้
ต้องการเครื่อง: macOS Apple Silicon, Python 3.11 Active Development
ดูซอร์สโค้ดบน GitHub → · ดาวน์โหลด →
ใช้ทำอะไรได้บ้าง
- ทำคลังเอกสาร Word, PDF, Excel, PowerPoint, ODF, text และภาพจากโฟลเดอร์ที่กำหนด
- ค้นด้วย filename + SQLite FTS5/BM25 + OCR fuzzy และ optional MiniLM semantic retrieval
- OCR เอกสารสแกนด้วย Apple Vision และเลือกใช้ local vision model ช่วยแก้ OCR ก่อนเขียน SQLite
- sync แบบ background พร้อม progress/ETA, persistent job id และ cooperative cancellation
- คืน absolute source path กับ page/location เพื่อเปิดเอกสารต้นฉบับและตรวจ trust of source
- ใช้ได้ทั้ง standalone MCP และเป็น Knowledge Base backend ของ ENDEAVOR AGENT LITE
บทความในหมวดนี้
เริ่มต้นใช้งาน MCP-RagDoc
สร้างคลัง Word/PDF/Office/เอกสารสแกนในเครื่องด้วย SQLite FTS5/BM25 + OCR fuzzy + optional MiniLM พร้อม source path/page provenance และ MCP 5 tools
MCP-RagDoc ทำงานอย่างไร — Document RAG ที่รักษา source truth
เจาะลึก MCP-RagDoc ตั้งแต่ recursive extraction/OCR, SQLite lexical index, optional MiniLM semantic generation, RRF fusion, persistent sync jobs และ provenance ไปถึงไฟล์/หน้าเดิม
MCP-RagDoc 5 tools — search, sync, status, cancel และ health
คู่มือ MCP surface ของ MCP-RagDoc: rag_search, sync_kb, sync_status, cancel_sync และ rag_health พร้อมขอบเขต source/state และ lifecycle ของ background sync