← 返回拾句全部内容

Surfagent:我用周末做了个“给 AI Agent 用的浏览器”,它居然真能干活

YouTube2026-06-15

摘要

Surfagent 让 AI 直接操控真实浏览器,绕过 API,像人一样上网干活。

**“The browser tool for AI agents.”**

深度解读

Surfagent:我用周末做了个“给 AI Agent 用的浏览器”,它居然真能干活

一句话总结:Surfagent 让 AI 直接操控真实浏览器,绕过 API,像人一样上网干活。


内容概览

  • 主题:AI Agent、浏览器自动化、Chrome CDP、无 API 操作、开源工具
  • 适合人群:做 AI 应用、Agent 工具链、自动化脚本、增长运营、爬虫/研究工具的人

核心观点

  1. AI Agent 最缺的不是模型,而是“能动手的手” 这次做出来的 Surfagent,本质上是在给 AI 补一双浏览器里的手。它不是只会回答,而是能在真实网页里点、搜、读、填表,甚至发帖。

  2. 先“侦察”再操作,速度和成功率会高很多 作者最满意的不是某个炫技功能,而是那个 recon 扫描流程:先把页面元素和结构摸清楚,再让 Agent 动作。这样浏览器自动化从“碰运气”变成“像人一样先看清楚再做”。

  3. 真正有价值的是:绕开 API,直接用登录态完成任务 Discord、X、Google Sheets、YouTube,这些场景的共同点是:你可以直接用自己已经登录好的网页环境,少接一堆 API、权限、额度、结构化限制。对很多真实业务来说,这比“更聪明的模型”还实用。


深度解读

一个周末项目,为什么看起来像“Agent 时代的缺口补上了”

这类视频最容易让人犯困的地方,是开发者一边展示工具,一边说“这很酷”。但 Surfagent 这个东西,酷不酷其实不重要,重要的是它正好打在了一个很现实的问题上:

今天的大模型会想,但还不会自己上网办事。

会聊天的 AI 已经太多了。真正稀缺的是那种能把“请你去 Discord 看看群里发生了什么”“把这几个模型价格填进表格”“去 X 上搜一下最新消息并发一条帖子”“把 YouTube 视频的 transcript 抠出来做总结”的事情,真的做完的 Agent。

作者说这是他“over the weekend”做出来的。听起来像顺手一搭,实际上很像很多 AI 工具创业的原型路线:
先别想做成一个“通用智能体平台”,先解决一个具体痛点。

他做的这个痛点就是:浏览器自动化 for AI agents

而且不是那种只会跑固定脚本的老式自动化,而是让 AI 能理解页面,自己找入口,自己动手操作。作者用的是 Chrome CDP 这类能力,意思很直白:不是去模拟一个很脆弱的脚本,而是直接接管一个真实浏览器会话。

这点特别关键。
因为很多所谓“Agent”,一到网页就歇菜。页面结构一变,脚本就报错;登录态一复杂,接口就断;再遇到验证码、前端渲染、动态按钮,事情就开始变味。

Surfagent 走的路线更像是:
别假装网页世界很规整,直接让 AI 在真实网页里活下来。


Discord 这个例子,说明了它不是“演示级工具”

视频里第一个让人眼前一亮的场景,是 Discord。

作者已经登录了自己的 Discord,然后直接对 Claude Code 说:
去 Bosy server,看一下 general 里发生了什么。

没有 API。
没有先去申请 token。
没有去对接 Discord 官方接口。
没有为每个频道写单独逻辑。

AI 直接进站,开始自己找频道、点 general、读消息。作者提到它会扫描最近 200 条消息,把上下文抓回来。

这背后其实挺有意思。

对很多团队来说,Discord、Slack、飞书群、Notion、内部知识库,这些地方才是信息真正流动的地方。问题是它们往往:

  • 没有统一的 API 方便整合
  • 权限复杂
  • 临时登录态很关键
  • 每个组织的页面结构又不完全一样

所以传统方案经常卡在“接入”这一步。
而 Surfagent 的做法很粗暴,也很有效:别再纠结接口,直接让浏览器去读。

你可以把这理解成一种很新的“企业知识获取方式”。
以前是 ETL:抽取、转换、加载。
现在可能变成:让 Agent 先像人一样逛一圈,再把信息变成上下文。

这跟爬虫还不一样。
爬虫是为了结构化抓取,目标是稳定复现。
Agent 自动化则更像临场发挥,目标是“完成任务”。

作者在 Discord 的演示里,已经不是“能不能抓到文本”的问题了,而是“能不能把群里发生的事变成可用上下文”。这一步很接近真正的生产场景。

重点不是读网页,而是把网页变成 AI 可以继续工作的记忆。


真正的技巧,不是自动点按钮,而是先做 recon

视频里反复提到一个词:recon

这个词原本有点军事味道,意思是侦察。
放在浏览器自动化里,就是先扫描页面上有什么、能点什么、输入框在哪、按钮在哪、结构怎么分布,然后再让 Agent 决策。

作者最开始也不是在炫“我能点开这个按钮”,而是在强调:
先 recon,再操作,速度会快很多。

这其实是整个工具最像样的地方。

很多浏览器 Agent 卡死,不是因为它不会想,而是因为它在一个复杂页面里“盲走”。
页面元素太多,按钮名字太乱,布局还会变。没有事先建模,AI 每走一步都像在黑屋里摸门把手。

recon 的价值就是把黑屋先照亮。

视频里他在 Hacker News 里测试,能读顶部帖子,能点第 10 条,能继续进入文章页面。
在 Google Sheets 里,他又让它去做一个研究任务:查四个模型的 API 价格——

  • Claude Opus 4.6
  • Sonnet 4.6
  • GPT-4.4
  • Gemini 4.1

然后把这些数据填进表格里。

这不是一个简单的“网页点击 demo”,而是一个完整工作流:

  1. 去外部网站搜索价格
  2. 把结果整理出来
  3. 回到 Google Sheets
  4. 自动填表
  5. 继续生成图表

这时候 recon 就显得非常值钱。
因为它不是让 Agent 在每一步都重新猜页面,而是先把页面空间扫描成“可操作地图”,后续动作就稳定得多。

说白了,Surfagent 的思路像是:

先给 AI 一张地形图,再让它出门。

这比“边走边猜”靠谱太多了。


Google Sheets 和 X:最实用的不是炫技,是“像人一样工作”

很多 AI 浏览器工具的演示都很像花活:
打开网页、点按钮、输入文字、截图结束。

Surfagent 的演示更接地气一点,因为它碰到的都是真实办公动作

比如 Google Sheets。

作者让它去找几家模型的 API 定价,然后把数据写进表格里。这个场景很像现实里的研究助理、增长分析、竞品整理、销售情报收集。

你可以想象一个团队平时怎么做这件事:

  • 一个人开十几个网页
  • 一个人复制价格
  • 一个人去 Sheets 手填
  • 可能还会顺手做个图

现在这件事如果交给 Agent,至少前半段就能自动化掉。

它还有个很重要的好处:
你不一定要等对方提供 API。

这在很多平台上都很现实。价格、内容、账号状态、帖子互动、视频 transcript,这些数据本来就在网页上。
既然人能看到,为什么 Agent 不行?

X 的例子也是一样。

作者登录了自己的 x.com,然后说:去找最新关于 cloud methods 的新闻。
工具会根据页面结构去探索、切换搜索、看 latest、继续收集上下文。

最后他甚至尝试让它写一条帖子并发布。

这个场景很值得注意,因为它暴露了一个关键趋势:
Agent 不是只能“查资料”,还会慢慢进入“代替你执行公开动作”的阶段。

一旦它能稳定地浏览、搜索、写入、发布,那很多“半自动运营”都会变得很不一样。

比如:

  • 监控某个话题
  • 整理热帖
  • 自动生成摘要
  • 形成待发布草稿
  • 甚至做一些轻量社媒运营

当然,视频里也很诚实地提到,这不是完美的。
但它已经能跑起来,已经能在真实站点上做事,这就比“只在沙盒里聪明”强太多了。


最值得记住的一点:它靠的不是 headless,而是“真浏览器”

视频里有个细节很重要,作者特地说了:

这不是 headless。

这意味着什么?

简单说,很多浏览器自动化工具会用无头模式,后台跑,不显示真实界面。
这样轻便、便宜、易部署,但问题也很明显:
有些网站会检测、某些交互不稳定、登录态和真实操作体验也可能出问题。

Surfagent 的思路更像是:
直接借一个真实可操作的浏览器环境,让 AI 在里面干活。

作者还提到自己有一台 Mac mini 在跑这个东西。
这就很真实了。
很多好用的 Agent 工具,最后不是卡在模型,而是卡在运行环境。

你得有:

  • 一个稳定的浏览器会话
  • 一个登录状态
  • 一个可持续运行的机器
  • 能让 AI 看到并操作页面的通道

所以这类系统的工程价值不只是“我写了个包”,而是它把 Agent 真正落进了浏览器世界。

这也是为什么他说它是 open source、可以 npm install。
当一个东西开始变成可安装的包,它才有机会被更多人拿去改成自己的工作流。


这个项目真正指向的,不是“自动化”,而是“Agent 的现实入口”

如果只看视频表面,你会觉得这就是一个浏览器自动化工具。
但如果往深一点看,它其实指向了一个更大的方向:

AI Agent 的第一批杀手级能力,不一定是写代码,而是代你跨网站干脏活累活。

这些活有几个共同点:

  • 重复
  • 依赖登录态
  • 没有统一 API
  • 需要在多个站点之间跳转
  • 需要把信息重新组织成可用上下文

这正是浏览器自动化最有价值的地方。

而 Surfagent 的巧思在于,它没有试图重新发明浏览器,也没有试图做一个特别复杂的“超级代理平台”。
它先做了一件很务实的事:

让 AI 能在真实网页里先看,再拿,再写,再交付。

这就够强了。

如果你是做 AI 产品的人,这里有几个很直接的启发:

  • 不要只盯着聊天能力,要想它能不能“完成任务”
  • 不要总想着做 API 整合,有些场景直接读网页更快
  • 不要把自动化做成死脚本,给 Agent 留空间
  • 页面扫描、结构识别、任务拆解,比单点点击更重要

如果你是做创业的人,这类工具也特别值得盯。
因为它不是纯技术玩具,而是一个可以长成:

  • 研究助手
  • 运营助手
  • 社媒助手
  • 竞品监控工具
  • 数据采集与整理工具
  • 内部知识抓取工具

的底座。

而且作者明显已经开始想“自动化流水线”和“被动收入”那一类的事情了。
这不是随口一提,是很多 Agent 工具创业者都会走到的下一步:
一旦浏览器动作可以稳定自动化,很多信息密集型工作都能被重组。


值得记住的话

“The browser tool for AI agents.”

“We don’t really need any APIs.”

“先 recon,再操作,速度会快很多。”

“This is not headless.”


标签

AI 工具 编程 创业 案例

更多值得记住的话

**“We don’t really need any APIs.”**
**“先 recon,再操作,速度会快很多。”**
**“This is not headless.”**