Context.dev 深度介绍:给 AI Agent 用的“实时网页数据层”

如果你的 AI 产品需要实时互联网数据,又不想自己维护浏览器、代理、爬虫、解析器和队列,Context.dev 想用一个 API 把这些都包掉。

以下内容包含AIGC

为什么需要它

AI 产品一旦要接入实时网页数据,团队往往要同时维护浏览器、代理、爬虫、解析器、队列、重试、缓存,甚至多家数据供应商。Context.dev 的创始人 Yahia Bakour 就是看到不少团队反复重建同一套基础设施才创业的。 该公司属于 YC 2026 夏季批次,YC 发布页称客户超过 400 家,包括 Mintlify、Passionfroot 和 Rho。 ycombinator

官方的说法是:网页是给人浏览的,不是给 Agent 理解的;模型已经不是主要瓶颈,上下文才是。 这些是厂商自己的表述,读的时候要有这个预期。 ycombinator

基础设施:你不用管的部分

官方文档列出了这些内置能力:docs.context

  • 浏览器:内置 JS 渲染。可通过 browser actions 在抓取前点击、输入、滚动。
  • 代理与重试:自动选择代理并重试,需要时可指定抓取国家。
  • 缓存:一次访问可拿多种格式,重复读取可复用缓存,并可控制新鲜度。
  • JS 渲染和托管代理始终开启,无法关闭,官方说这是为了保证质量和可靠性。

能力地图

文档按“你有什么、想要什么”给出选择表,整理如下:docs.context

你有 你想要 用
一个 URL 页面内容、结构化数据或截图 Scrape
一个域名 其 URL 列表(含可用的标题和描述) Map
一个起始 URL 一次返回多个链接页面的 Markdown Crawl
一个搜索词 排序后的搜索结果,可附带页面内容 Search
一个研究问题和 JSON 结构 符合该结构的答案,附来源 URL Answers
PDF、Office 文档、图片等文件 Markdown 内容 Parse
URL 列表或要爬取的站点 后台任务结果 Batches
要监视的页面或站点 变化时的 webhook Monitors

此外还有 Brand(logo、颜色、字体等)、People(人物查找和信息补全)、News(公司最新报道)。 docs.context

Answers 详解

POST /web/answers 接收 task(问题,最长 2000 字符)和 json_format(带占位值的示例对象)。 docs.context

  • json_format 是示例对象,不是 JSON Schema,key 和值类型会被保留。
  • 限制是最多 8 层嵌套、500 个值、16,000 个序列化字符。
  • 查不到的事实返回 null,应用里要自行处理。
  • 建议加入源 URL 字段,方便追溯每个结果。
1
2
3
4
5
6
7
{
"task": "Stripe 和 GitHub 的 API 分别使用什么认证方式?",
"json_format": {
"stripe": { "auth_method": "string", "source_url": "string" },
"github": { "auth_method": "string", "source_url": "string" }
}
}

Scrape 示例

文档里的最简调用是抓取一个页面,只取主要内容,输出 Markdown: docs.context

1
2
3
4
5
6
7
8
9
curl https://api.context.dev/v1/web/scrape \
--request POST \
--header "Authorization: Bearer $CONTEXT_DEV_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"url": "https://example.com",
"formats": { "markdown": true },
"sharedParams": { "mainContentOnly": true }
}'

页面正文在 markdown.data,标题和描述在 metadata。SDK 支持 TypeScript、Python、Ruby、Go 和 PHP。 docs.context

Highlights:省 token 的抽取

Context Highlights 在 9 月 28 日发布。输入网页和问题,它返回选中的段落及附近上下文,是抽取式的,不是模型生成的摘要。可通过 scrape API 和 MCP 使用。

官方基准测试的数字如下,全部来自公司自己的测试:

  • 在 250 题的 WebCode 基准上,Highlights 的 groundedness 为 76.0%,平均输出 229 token。
  • Codex 原生开网页工具为 57.6%,6,889 token,“少 97% token”就是由此而来。
  • Exa Highlights 为 75.6%、286 token,和 Context 的质量接近,token 少约 20%。

报道也指出,Codex 的基线只是单次调用,没有传入问题,也没有后续调用,所以这个比较偏向 Context.dev。独立评测还没有出现。

Agent 集成

文档提供三种方式:docs.context

  • Agent quickstart:给编码 Agent 一段提示词,自动选择配置、连接账号并验证第一次调用。
  • MCP server:提供实时工具。
  • Skill 和 CLI:Skill 让 Agent 学会这套 API,CLI 适合脚本。

客户案例

YC 发布页给出的例子:ycombinator

  • Soria 监控数百个医疗和金融信息源。
  • Murph 结构化了 200 万以上的食品、补剂和检测数据。
  • Mintlify 把 GitHub 仓库转成定制品牌文档。
  • Executor 发现并结构化 3,000 多个集成的 API 文档。
  • Dench 监控社交平台寻找线索,称带来 300 万美元以上的销售管线。

和同类产品的区别

维度 Context.dev Perplexity Tavily Brave Search API
定位 网页数据 API:抓取、解析、公司数据 面向终端用户的问答产品,也有 API 面向 Agent 的 Web 访问层 tavily 独立搜索索引加 AI 端点 brave
回答类接口 /web/answers,按 JSON 样例返回 docs.context 带引用的自然语言 Search 可选 LLM 答案;Research 支持结构化输出 tavily Answers 带引用;LLM Context 返回原始内容
数据来源 联网查找,内部未写明 自有检索 自有爬虫加第三方聚合 brave 自有独立索引 brave
价格参考 抓取 1 credit 每页 以官网为准 以官网为准 Search 约 $5/1,000 次 brave

适合与不适合

适合:

  • 需要实时网页数据的 AI 产品、RAG 和 Agent。
  • 要把网页变成固定字段 JSON 并入库的工作流。
  • 不想自己运维浏览器和代理的小团队。

需要权衡:

  • 它是托管服务,不能自托管。
  • JS 渲染和代理不能关闭,对简单静态页可能是多余成本。
  • Answers 的内部步骤没有公开,重要数据要自己抽查来源和校验 null。
  • Highlights 的 benchmark 是厂商自测。

领取 10,000 credits

新用户按 YC 发布页的说法有 500 免费 credits(博主实测有1000)、无需信用卡。
当前有个活动可以领取 10000 积分(积分有效期30天):ycombinator

无法保证活动的有效期和名额,请以官方页面为准。

Buy me a coffee ☕