Research Tooling Loop · Markdown/PDF 可下载

AI Agent 搜索与抓取工具全景
先分层,再选型

把 Tavily、Firecrawl、Exa、Perplexity、Jina、Serper、OpenAI Web Search、Claude Web Search 和 Agent-Reach 放回正确位置:搜索、抓取、模型内置搜索和一手内容采集不是同一件事。

下载资料

4 类

工具分层

18+

工具对比

2026.06

价格快照

Loop

选型方法

学完你能做什么

  • 区分 Search API、Scrape/Crawl API、模型内置 Web Search 和 Agent-Reach
  • 理解 Tavily、Exa、Brave、Serper、SerpAPI、Perplexity、You.com 的定位差异
  • 判断 Firecrawl、Jina Reader、Apify、ZenRows、ScrapingBee、Bright Data 什么时候该用
  • 说清 Codex/OpenAI 与 Claude 自己的搜索方法为什么不是普通 Search API
  • 把 Agent-Reach 放到平台一手内容采集和研究验证的位置
  • 为自己的 agent 设计 search -> fetch -> extract -> cite -> cache 的闭环

课程资料下载

提交信息后下载

资料会先通过轻量问卷收集邮箱、电话和兴趣话题,再开放下载。

为了把资料发给真正感兴趣的人,下载前请留下基本信息和你关心的话题。提交后会自动打开资料。

课程结构

从工具分类,到价格信号,再到 agent 信息获取链路设计。

Now
Week 01

先分清四类能力

Search、Scrape、内置 Web Search、Agent-Reach

Week 02

Search API 全景

Tavily、Exa、Brave、Serper、SerpAPI、Perplexity、You.com

Week 03

Scrape / Crawl 全景

Firecrawl、Jina、Apify、ZenRows、ScrapingBee、Bright Data

Week 04

模型内置搜索

OpenAI Responses API 与 Claude API 的 Web Search / Fetch

Week 05

Agent-Reach

平台一手内容、评论、截图和内容语言研究

Week 06

选型闭环

search -> fetch -> extract -> cite -> cache -> review

核心方法

不要把搜索、抓取和模型搜索混成一个问题

Search API 找来源,Scrape API 读网页,模型内置搜索直接综合,Agent-Reach 拿平台一手信号。

适合作为工具选型课或内部架构评审材料
建议 60–90 分钟
研究报告 + 讲稿
PDF + Markdown

标准信息获取 Loop

  • 用 Search API 发现候选来源
  • 用 Scrape/Crawl API 读取正文和结构化内容
  • 用 LLM 做证据归纳、引用和判断
  • 用 Agent-Reach 补充普通搜索看不到的平台一手内容
  • 保存来源、时间、价格快照和不确定性
  • 把高风险结论交给人工抽样复核

4 层工具地图

Search API

query -> results

适合事实查找、候选来源、SERP、引用发现和 RAG 检索入口。

Scrape / Crawl

URL -> markdown

适合网页正文、站点抓取、PDF/文档读取和结构化抽取。

Built-in Web Search

prompt -> cited answer

适合让 OpenAI 或 Claude 一轮内完成搜索、阅读、引用和综合。

Agent-Reach

platform signals

适合平台一手内容、评论、互动结构和截图类研究。

选型 Checklist

选工具前先回答:

1. 输入是 query 还是 URL?
2. 要裸结果、正文、结构化字段,还是带引用答案?
3. 是否需要 Google/Brave/语义索引的可控结果?
4. 是否需要处理 JS、代理、验证码或站点地图?
5. 是否需要模型自己判断何时搜索?
6. 是否需要平台内的一手内容和评论?
7. 结果是否要缓存、复用、跨模型迁移?
8. 结论是否需要人工抽样复核?

建议讲授节奏

时间时长模块动作
00:00–10:0010 min为什么工具不能混着比讲解
10:00–25:0015 minSearch API 价格与能力对比对比
25:00–40:0015 minScrape/Crawl API 与 URL-to-markdown拆解
40:00–55:0015 minOpenAI / Claude Web Search 的真实位置架构
55:00–75:0020 minAgent-Reach 与一手内容研究案例
75:00–90:0015 min选型决策树和省钱组合实操

适合谁

适合正在搭 agent、RAG、知识库、研究自动化或内容研究流程的人。

适合 ✓

  • AI agent / RAG 产品开发者
  • 需要做外部资料检索和引用的研究团队
  • 正在比较 Tavily、Firecrawl、Exa、Perplexity、Jina 的团队
  • 需要把社媒一手内容纳入研究流程的内容团队

不适合 ✗

  • 只想要不区分来源的一键答案
  • 不愿意核对价格、来源和平台规则
  • 希望绕过平台限制或批量采集非公开数据

常见问题

Tavily 和 Firecrawl 到底怎么分?

Tavily 更偏 Search API,负责从 query 找来源和摘要;Firecrawl 更偏 Scrape/Crawl,负责把 URL 或网站变成 markdown、正文和结构化内容。

OpenAI / Claude Web Search 能替代 Tavily 或 Exa 吗?

能替代一部分一轮式问答,但不等于可控 Search API。如果你要裸结果、自己排序、缓存、跨模型复用,仍然需要独立检索层。

Agent-Reach 应该放在哪一类?

它更像平台一手内容采集和研究工具,适合补充普通搜索看不到的帖子、评论、互动和截图信号。

想给你的 agent 设计可控的信息获取链路?

我们可以帮你把搜索、抓取、引用、缓存、人工复核和 Agent-Reach 一手内容采集设计成可执行的 loop。

下载资料