Web Fetch ≠ Web Search:理解抓取和搜索的重要区别

2025年9月10日,Anthropic 在已有的 Web Search 基础上,又推出了一个新工具:Web Fetch。你现在可以在请求中添加 web fetch 工具,Claude 将会抓取并分析任何网页 URL 的内容。

为什么已经有了搜索,还要再出一个抓取工具?这个表格就能够解答你的疑惑。

工具返回结果
Web Search搜索页摘要,标题、链接、小段摘要
Web Fetch网页全文

Web Search返回的只是摘要页

自从各家大模型陆续支持联网搜索后,理论上它能获取实时信息、回答最新的问题。但很多人很快发现:接了搜索之后,效果并没有想象中那么好。模型的回答还是很浅,有时候甚至答非所问。

问题出在一个容易被忽略的细节上:Web Search 返回的不是网页的完整内容,而是类似谷歌搜索结果页那样的东西——标题、URL、还有一小段摘要。

想想平时用谷歌搜索的体验:搜出来一堆结果,每条只有两三行描述。如果你不点进去看原文,你其实对这些内容的理解是非常有限的。

而正常情况下,用户会在谷歌搜索页进行一次筛选,找到自己需要的网页,点进去深入阅读。这就是 Web Fetch 要解决的问题。

Web Fetch 才是网页全文

Anthropic 的 Web Fetch 工具可以从指定网页和 PDF 中获取完整内容,让 Agent 能够直接访问原始材料进行分析。

简单说,Search 告诉你”哪里可能有答案”,Fetch 则是”把答案拿回来仔细看”。两者结合使用,才能真正发挥联网搜索的价值。

抓取差异:HTML 还是纯文本?

这里还有一个值得注意的技术细节:Web Fetch 究竟返回的是什么格式的内容?

不同的实现方式差异很大。有些工具会返回页面的原始 HTML,有些则会清理成纯文本或 Markdown。

原始 HTML 充满了大量对 AI 无用的内容:导航栏、广告代码、脚本标签、CSS 样式……这些东西不仅浪费 tokens,还会干扰模型对核心内容的理解。清理成纯文本或 Markdown 后,模型能更高效地处理真正有价值的信息。

很多人采用的搜索提供商 Tavily 就专门提供了类似的专门的 Extract API ,返回的内容则是清理后的结果,转换成了Markdown格式,而非原始HTML。


已发布

分类

来自

评论

发表评论

了解 AI前哨 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读