AI Agent 搜索与抓取工具全景
先分层,再选型
把 Tavily、Firecrawl、Exa、Perplexity、Jina、Serper、OpenAI Web Search、Claude Web Search 和 Agent-Reach 放回正确位置:搜索、抓取、模型内置搜索和一手内容采集不是同一件事。
4 类
工具分层
18+
工具对比
2026.06
价格快照
Loop
选型方法
学完你能做什么
- 区分 Search API、Scrape/Crawl API、模型内置 Web Search 和 Agent-Reach
- 理解 Tavily、Exa、Brave、Serper、SerpAPI、Perplexity、You.com 的定位差异
- 判断 Firecrawl、Jina Reader、Apify、ZenRows、ScrapingBee、Bright Data 什么时候该用
- 说清 Codex/OpenAI 与 Claude 自己的搜索方法为什么不是普通 Search API
- 把 Agent-Reach 放到平台一手内容采集和研究验证的位置
- 为自己的 agent 设计 search -> fetch -> extract -> cite -> cache 的闭环
课程资料下载
提交信息后下载资料会先通过轻量问卷收集邮箱、电话和兴趣话题,再开放下载。
为了把资料发给真正感兴趣的人,下载前请留下基本信息和你关心的话题。提交后会自动打开资料。
课程结构
从工具分类,到价格信号,再到 agent 信息获取链路设计。
先分清四类能力
Search、Scrape、内置 Web Search、Agent-Reach
Search API 全景
Tavily、Exa、Brave、Serper、SerpAPI、Perplexity、You.com
Scrape / Crawl 全景
Firecrawl、Jina、Apify、ZenRows、ScrapingBee、Bright Data
模型内置搜索
OpenAI Responses API 与 Claude API 的 Web Search / Fetch
Agent-Reach
平台一手内容、评论、截图和内容语言研究
选型闭环
search -> fetch -> extract -> cite -> cache -> review
不要把搜索、抓取和模型搜索混成一个问题
Search API 找来源,Scrape API 读网页,模型内置搜索直接综合,Agent-Reach 拿平台一手信号。
标准信息获取 Loop
- 用 Search API 发现候选来源
- 用 Scrape/Crawl API 读取正文和结构化内容
- 用 LLM 做证据归纳、引用和判断
- 用 Agent-Reach 补充普通搜索看不到的平台一手内容
- 保存来源、时间、价格快照和不确定性
- 把高风险结论交给人工抽样复核
4 层工具地图
Search API
query -> results
适合事实查找、候选来源、SERP、引用发现和 RAG 检索入口。
Scrape / Crawl
URL -> markdown
适合网页正文、站点抓取、PDF/文档读取和结构化抽取。
Built-in Web Search
prompt -> cited answer
适合让 OpenAI 或 Claude 一轮内完成搜索、阅读、引用和综合。
Agent-Reach
platform signals
适合平台一手内容、评论、互动结构和截图类研究。
选型 Checklist
选工具前先回答: 1. 输入是 query 还是 URL? 2. 要裸结果、正文、结构化字段,还是带引用答案? 3. 是否需要 Google/Brave/语义索引的可控结果? 4. 是否需要处理 JS、代理、验证码或站点地图? 5. 是否需要模型自己判断何时搜索? 6. 是否需要平台内的一手内容和评论? 7. 结果是否要缓存、复用、跨模型迁移? 8. 结论是否需要人工抽样复核?
建议讲授节奏
| 时间 | 时长 | 模块 | 动作 |
|---|---|---|---|
| 00:00–10:00 | 10 min | 为什么工具不能混着比 | 讲解 |
| 10:00–25:00 | 15 min | Search API 价格与能力对比 | 对比 |
| 25:00–40:00 | 15 min | Scrape/Crawl API 与 URL-to-markdown | 拆解 |
| 40:00–55:00 | 15 min | OpenAI / Claude Web Search 的真实位置 | 架构 |
| 55:00–75:00 | 20 min | Agent-Reach 与一手内容研究 | 案例 |
| 75:00–90:00 | 15 min | 选型决策树和省钱组合 | 实操 |
适合谁
适合正在搭 agent、RAG、知识库、研究自动化或内容研究流程的人。
适合 ✓
- AI agent / RAG 产品开发者
- 需要做外部资料检索和引用的研究团队
- 正在比较 Tavily、Firecrawl、Exa、Perplexity、Jina 的团队
- 需要把社媒一手内容纳入研究流程的内容团队
不适合 ✗
- 只想要不区分来源的一键答案
- 不愿意核对价格、来源和平台规则
- 希望绕过平台限制或批量采集非公开数据
常见问题
Tavily 和 Firecrawl 到底怎么分?
Tavily 更偏 Search API,负责从 query 找来源和摘要;Firecrawl 更偏 Scrape/Crawl,负责把 URL 或网站变成 markdown、正文和结构化内容。
OpenAI / Claude Web Search 能替代 Tavily 或 Exa 吗?
能替代一部分一轮式问答,但不等于可控 Search API。如果你要裸结果、自己排序、缓存、跨模型复用,仍然需要独立检索层。
Agent-Reach 应该放在哪一类?
它更像平台一手内容采集和研究工具,适合补充普通搜索看不到的帖子、评论、互动和截图信号。