Tool: fetch_sitemap — ดึงรายชื่อ URL ครบทั้งเว็บจาก sitemap.xml แทนการค้นทีละหน้า

fetch_sitemap อ่าน sitemap ของเว็บไซต์เพื่อรวบรวมรายการ URL อย่างเป็นระบบ เหมาะสำหรับเริ่มงานวิจัยจากเว็บขนาดใหญ่ก่อนเลือกหน้าที่ต้องอ่านต่อ
Tool นี้คืออะไร
ดึงไฟล์ sitemap.xml ที่เว็บไซต์ส่วนใหญ่เผยแพร่ไว้เองอยู่แล้ว (สำหรับให้ search engine เก็บ index) มา parse เป็นรายการ URL ทั้งหมด — รองรับทั้ง <urlset> (รายการ URL ตรงๆ) และ <sitemapindex> (sitemap แม่ที่ชี้ไปหา sitemap ลูกหลายไฟล์ ดึงลูกสูงสุด 3 ไฟล์) และมี fallback ตรวจ robots.txt หา location ของ sitemap ถ้าไม่เจอที่ path มาตรฐาน
Agent เรียก tool นี้เมื่อไร
Docstring บอกไว้ตรงๆ ว่าใช้แทน web_search เมื่อรู้ว่าข้อมูลอยู่ในเว็บใดเว็บหนึ่งเจาะจง เช่น “กองทุนทั้งหมดใน finnomena”, “สินค้าทุกชิ้นในร้านนี้”, “บทความทุกชิ้นของเว็บนี้” — เหตุผลสำคัญ: web_search คืนแค่บางหน้าที่ search engine เห็นว่าเกี่ยวข้อง ไม่ใช่รายการครบถ้วน แต่ sitemap.xml มี URL ครบทุกหน้าที่เว็บไซต์นั้นตั้งใจเผยแพร่ พร้อม parse ได้ทันทีโดยไม่ต้องเดา
ตัวอย่างเปรียบเทียบ: ถ้าถามหา “กองทุน RMF ทั้งหมดใน finnomena” — web_search อาจคืนแค่ 5-10 บทความยอดนิยม แต่ fetch_sitemap("finnomena.com", filter_keyword="RMF") คืนรายชื่อ URL ที่มี “RMF” ในตัวเองทุก URL ที่ sitemap มี ครบถ้วนกว่ามาก
กรองด้วย keyword ก่อนคืนผล
พารามิเตอร์ filter_keyword กรอง URL ที่มีคำนี้ปรากฏอยู่ในตัว URL เอง (ไม่ใช่เนื้อหาหน้า) เช่น "/fund/", "RMF", "2024" — ถ้ากรองแล้วไม่เจอเลย tool จะบอกจำนวน URL ทั้งหมดที่มีและโชว์ตัวอย่าง 10 อันแรก ให้ agent ปรับ keyword ใหม่แทนที่จะได้แค่ “ไม่พบผล” เฉยๆ
จำกัดจำนวน URL ที่คืน
ผลลัพธ์สูงสุดที่คืนกลับจำกัดไว้ (FETCH_SITEMAP_MAX_URLS, ดีฟอลต์ 200) — เว็บใหญ่ๆ อาจมี URL หลักหมื่นหลักแสนใน sitemap ถ้าคืนทั้งหมดจะบวม context ทันที การจำกัดจำนวนไว้ทำให้ context ยังจัดการได้ ในขณะที่ยังได้รายการที่ครอบคลุมกว่าการค้นทีละหน้ามาก
ผลลัพธ์เป็นแค่รายการ URL — ต้องต่อด้วย tool อื่นเพื่ออ่านเนื้อหาจริง
fetch_sitemap แก้ปัญหา “หา URL ครบไหม” เท่านั้น ไม่ได้อ่านเนื้อหาแต่ละหน้าให้ — ขั้นตอนถัดไปตามธรรมชาติคือส่งรายการ URL ที่ได้ต่อให้ batch_browse หรือ tool_loop (action browse_summarize) เพื่ออ่าน/สรุปทีละหน้าต่อ — การแยกความรับผิดชอบแบบนี้ (หา URL ↔ อ่านเนื้อหา) ทำให้แต่ละ tool ทำหน้าที่เดียวชัดเจน ไม่ต้องมี tool ที่ทำทั้งสองอย่างพร้อมกันแบบซับซ้อน
ทำไมเรื่องนี้ถึงสำคัญ
fetch_sitemap เป็นตัวอย่างของการใช้โครงสร้างที่เว็บไซต์เผยแพร่เองอยู่แล้วแทนการพยายามเดา/ค้นแบบ heuristic — sitemap.xml ถูกออกแบบมาเพื่อบอก “นี่คือ URL ทั้งหมดที่ฉันมี” อยู่แล้ว การอ่านมันตรงๆ แม่นยำและครบถ้วนกว่าการพึ่งผลค้นจาก search engine ที่คัดกรองมาแล้วเสมอ เมื่อรู้ว่าข้อมูลเป้าหมายอยู่ในเว็บเดียว
ความคิดเห็น
กำลังโหลดความคิดเห็น...