如果你的 AI 产品需要实时互联网数据,又不想自己维护浏览器、代理、爬虫、解析器和队列,Context.dev 想用一个 API 把这些都包掉。
以下内容包含AIGC
为什么需要它
AI 产品一旦要接入实时网页数据,团队往往要同时维护浏览器、代理、爬虫、解析器、队列、重试、缓存,甚至多家数据供应商。Context.dev 的创始人 Yahia Bakour 就是看到不少团队反复重建同一套基础设施才创业的。 该公司属于 YC 2026 夏季批次,YC 发布页称客户超过 400 家,包括 Mintlify、Passionfroot 和 Rho。 ycombinator
官方的说法是:网页是给人浏览的,不是给 Agent 理解的;模型已经不是主要瓶颈,上下文才是。 这些是厂商自己的表述,读的时候要有这个预期。 ycombinator
基础设施:你不用管的部分
官方文档列出了这些内置能力:docs.context
- 浏览器:内置 JS 渲染。可通过 browser actions 在抓取前点击、输入、滚动。
- 代理与重试:自动选择代理并重试,需要时可指定抓取国家。
- 缓存:一次访问可拿多种格式,重复读取可复用缓存,并可控制新鲜度。
- JS 渲染和托管代理始终开启,无法关闭,官方说这是为了保证质量和可靠性。
能力地图
文档按“你有什么、想要什么”给出选择表,整理如下:docs.context
| 你有 | 你想要 | 用 |
|---|---|---|
| 一个 URL | 页面内容、结构化数据或截图 | Scrape |
| 一个域名 | 其 URL 列表(含可用的标题和描述) | Map |
| 一个起始 URL | 一次返回多个链接页面的 Markdown | Crawl |
| 一个搜索词 | 排序后的搜索结果,可附带页面内容 | Search |
| 一个研究问题和 JSON 结构 | 符合该结构的答案,附来源 URL | Answers |
| PDF、Office 文档、图片等文件 | Markdown 内容 | Parse |
| URL 列表或要爬取的站点 | 后台任务结果 | Batches |
| 要监视的页面或站点 | 变化时的 webhook | Monitors |
此外还有 Brand(logo、颜色、字体等)、People(人物查找和信息补全)、News(公司最新报道)。 docs.context
Answers 详解
POST /web/answers 接收 task(问题,最长 2000 字符)和 json_format(带占位值的示例对象)。 docs.context
json_format是示例对象,不是 JSON Schema,key 和值类型会被保留。- 限制是最多 8 层嵌套、500 个值、16,000 个序列化字符。
- 查不到的事实返回
null,应用里要自行处理。 - 建议加入源 URL 字段,方便追溯每个结果。
1 | { |
Scrape 示例
文档里的最简调用是抓取一个页面,只取主要内容,输出 Markdown: docs.context
1 | curl https://api.context.dev/v1/web/scrape \ |
页面正文在 markdown.data,标题和描述在 metadata。SDK 支持 TypeScript、Python、Ruby、Go 和 PHP。 docs.context
Highlights:省 token 的抽取
Context Highlights 在 9 月 28 日发布。输入网页和问题,它返回选中的段落及附近上下文,是抽取式的,不是模型生成的摘要。可通过 scrape API 和 MCP 使用。
官方基准测试的数字如下,全部来自公司自己的测试:
- 在 250 题的 WebCode 基准上,Highlights 的 groundedness 为 76.0%,平均输出 229 token。
- Codex 原生开网页工具为 57.6%,6,889 token,“少 97% token”就是由此而来。
- Exa Highlights 为 75.6%、286 token,和 Context 的质量接近,token 少约 20%。
报道也指出,Codex 的基线只是单次调用,没有传入问题,也没有后续调用,所以这个比较偏向 Context.dev。独立评测还没有出现。
Agent 集成
文档提供三种方式:docs.context
- Agent quickstart:给编码 Agent 一段提示词,自动选择配置、连接账号并验证第一次调用。
- MCP server:提供实时工具。
- Skill 和 CLI:Skill 让 Agent 学会这套 API,CLI 适合脚本。
客户案例
YC 发布页给出的例子:ycombinator
- Soria 监控数百个医疗和金融信息源。
- Murph 结构化了 200 万以上的食品、补剂和检测数据。
- Mintlify 把 GitHub 仓库转成定制品牌文档。
- Executor 发现并结构化 3,000 多个集成的 API 文档。
- Dench 监控社交平台寻找线索,称带来 300 万美元以上的销售管线。
和同类产品的区别
| 维度 | Context.dev | Perplexity | Tavily | Brave Search API |
|---|---|---|---|---|
| 定位 | 网页数据 API:抓取、解析、公司数据 | 面向终端用户的问答产品,也有 API | 面向 Agent 的 Web 访问层 tavily | 独立搜索索引加 AI 端点 brave |
| 回答类接口 | /web/answers,按 JSON 样例返回 docs.context |
带引用的自然语言 | Search 可选 LLM 答案;Research 支持结构化输出 tavily | Answers 带引用;LLM Context 返回原始内容 |
| 数据来源 | 联网查找,内部未写明 | 自有检索 | 自有爬虫加第三方聚合 brave | 自有独立索引 brave |
| 价格参考 | 抓取 1 credit 每页 | 以官网为准 | 以官网为准 | Search 约 $5/1,000 次 brave |
适合与不适合
适合:
- 需要实时网页数据的 AI 产品、RAG 和 Agent。
- 要把网页变成固定字段 JSON 并入库的工作流。
- 不想自己运维浏览器和代理的小团队。
需要权衡:
- 它是托管服务,不能自托管。
- JS 渲染和代理不能关闭,对简单静态页可能是多余成本。
- Answers 的内部步骤没有公开,重要数据要自己抽查来源和校验
null。 - Highlights 的 benchmark 是厂商自测。
领取 10,000 credits
新用户按 YC 发布页的说法有 500 免费 credits(博主实测有1000)、无需信用卡。
当前有个活动可以领取 10000 积分(积分有效期30天):ycombinator
- 兑换链接: http://context.dev/dashboard/redeem-credits
- 兑换码:
HAPPYCODING
无法保证活动的有效期和名额,请以官方页面为准。