2025年9月10日,Anthropic 在已有的 Web Search 基础上,又推出了一个新工具:Web Fetch。你现在可以在请求中添加 web fetch 工具,Claude 将会抓取并分析任何网页 URL 的内容。
为什么已经有了搜索,还要再出一个抓取工具?这个表格就能够解答你的疑惑。
| 工具 | 返回结果 |
| Web Search | 搜索页摘要,标题、链接、小段摘要 |
| Web Fetch | 网页全文 |
Web Search返回的只是摘要页
自从各家大模型陆续支持联网搜索后,理论上它能获取实时信息、回答最新的问题。但很多人很快发现:接了搜索之后,效果并没有想象中那么好。模型的回答还是很浅,有时候甚至答非所问。
问题出在一个容易被忽略的细节上:Web Search 返回的不是网页的完整内容,而是类似谷歌搜索结果页那样的东西——标题、URL、还有一小段摘要。
想想平时用谷歌搜索的体验:搜出来一堆结果,每条只有两三行描述。如果你不点进去看原文,你其实对这些内容的理解是非常有限的。
而正常情况下,用户会在谷歌搜索页进行一次筛选,找到自己需要的网页,点进去深入阅读。这就是 Web Fetch 要解决的问题。
Web Fetch 才是网页全文
Anthropic 的 Web Fetch 工具可以从指定网页和 PDF 中获取完整内容,让 Agent 能够直接访问原始材料进行分析。
简单说,Search 告诉你”哪里可能有答案”,Fetch 则是”把答案拿回来仔细看”。两者结合使用,才能真正发挥联网搜索的价值。
抓取差异:HTML 还是纯文本?
这里还有一个值得注意的技术细节:Web Fetch 究竟返回的是什么格式的内容?
不同的实现方式差异很大。有些工具会返回页面的原始 HTML,有些则会清理成纯文本或 Markdown。
原始 HTML 充满了大量对 AI 无用的内容:导航栏、广告代码、脚本标签、CSS 样式……这些东西不仅浪费 tokens,还会干扰模型对核心内容的理解。清理成纯文本或 Markdown 后,模型能更高效地处理真正有价值的信息。
很多人采用的搜索提供商 Tavily 就专门提供了类似的专门的 Extract API ,返回的内容则是清理后的结果,转换成了Markdown格式,而非原始HTML。


发表评论