Surfagent:我用周末做了个“给 AI Agent 用的浏览器”,它居然真能干活
摘要
Surfagent 让 AI 直接操控真实浏览器,绕过 API,像人一样上网干活。
❝**“The browser tool for AI agents.”**❞
深度解读
Surfagent:我用周末做了个“给 AI Agent 用的浏览器”,它居然真能干活
一句话总结:Surfagent 让 AI 直接操控真实浏览器,绕过 API,像人一样上网干活。
内容概览
- 主题:AI Agent、浏览器自动化、Chrome CDP、无 API 操作、开源工具
- 适合人群:做 AI 应用、Agent 工具链、自动化脚本、增长运营、爬虫/研究工具的人
核心观点
-
AI Agent 最缺的不是模型,而是“能动手的手” 这次做出来的 Surfagent,本质上是在给 AI 补一双浏览器里的手。它不是只会回答,而是能在真实网页里点、搜、读、填表,甚至发帖。
-
先“侦察”再操作,速度和成功率会高很多 作者最满意的不是某个炫技功能,而是那个 recon 扫描流程:先把页面元素和结构摸清楚,再让 Agent 动作。这样浏览器自动化从“碰运气”变成“像人一样先看清楚再做”。
-
真正有价值的是:绕开 API,直接用登录态完成任务 Discord、X、Google Sheets、YouTube,这些场景的共同点是:你可以直接用自己已经登录好的网页环境,少接一堆 API、权限、额度、结构化限制。对很多真实业务来说,这比“更聪明的模型”还实用。
深度解读
一个周末项目,为什么看起来像“Agent 时代的缺口补上了”
这类视频最容易让人犯困的地方,是开发者一边展示工具,一边说“这很酷”。但 Surfagent 这个东西,酷不酷其实不重要,重要的是它正好打在了一个很现实的问题上:
今天的大模型会想,但还不会自己上网办事。
会聊天的 AI 已经太多了。真正稀缺的是那种能把“请你去 Discord 看看群里发生了什么”“把这几个模型价格填进表格”“去 X 上搜一下最新消息并发一条帖子”“把 YouTube 视频的 transcript 抠出来做总结”的事情,真的做完的 Agent。
作者说这是他“over the weekend”做出来的。听起来像顺手一搭,实际上很像很多 AI 工具创业的原型路线:
先别想做成一个“通用智能体平台”,先解决一个具体痛点。
他做的这个痛点就是:浏览器自动化 for AI agents。
而且不是那种只会跑固定脚本的老式自动化,而是让 AI 能理解页面,自己找入口,自己动手操作。作者用的是 Chrome CDP 这类能力,意思很直白:不是去模拟一个很脆弱的脚本,而是直接接管一个真实浏览器会话。
这点特别关键。
因为很多所谓“Agent”,一到网页就歇菜。页面结构一变,脚本就报错;登录态一复杂,接口就断;再遇到验证码、前端渲染、动态按钮,事情就开始变味。
Surfagent 走的路线更像是:
别假装网页世界很规整,直接让 AI 在真实网页里活下来。
Discord 这个例子,说明了它不是“演示级工具”
视频里第一个让人眼前一亮的场景,是 Discord。
作者已经登录了自己的 Discord,然后直接对 Claude Code 说:
去 Bosy server,看一下 general 里发生了什么。
没有 API。
没有先去申请 token。
没有去对接 Discord 官方接口。
没有为每个频道写单独逻辑。
AI 直接进站,开始自己找频道、点 general、读消息。作者提到它会扫描最近 200 条消息,把上下文抓回来。
这背后其实挺有意思。
对很多团队来说,Discord、Slack、飞书群、Notion、内部知识库,这些地方才是信息真正流动的地方。问题是它们往往:
- 没有统一的 API 方便整合
- 权限复杂
- 临时登录态很关键
- 每个组织的页面结构又不完全一样
所以传统方案经常卡在“接入”这一步。
而 Surfagent 的做法很粗暴,也很有效:别再纠结接口,直接让浏览器去读。
你可以把这理解成一种很新的“企业知识获取方式”。
以前是 ETL:抽取、转换、加载。
现在可能变成:让 Agent 先像人一样逛一圈,再把信息变成上下文。
这跟爬虫还不一样。
爬虫是为了结构化抓取,目标是稳定复现。
Agent 自动化则更像临场发挥,目标是“完成任务”。
作者在 Discord 的演示里,已经不是“能不能抓到文本”的问题了,而是“能不能把群里发生的事变成可用上下文”。这一步很接近真正的生产场景。
重点不是读网页,而是把网页变成 AI 可以继续工作的记忆。
真正的技巧,不是自动点按钮,而是先做 recon
视频里反复提到一个词:recon。
这个词原本有点军事味道,意思是侦察。
放在浏览器自动化里,就是先扫描页面上有什么、能点什么、输入框在哪、按钮在哪、结构怎么分布,然后再让 Agent 决策。
作者最开始也不是在炫“我能点开这个按钮”,而是在强调:
先 recon,再操作,速度会快很多。
这其实是整个工具最像样的地方。
很多浏览器 Agent 卡死,不是因为它不会想,而是因为它在一个复杂页面里“盲走”。
页面元素太多,按钮名字太乱,布局还会变。没有事先建模,AI 每走一步都像在黑屋里摸门把手。
recon 的价值就是把黑屋先照亮。
视频里他在 Hacker News 里测试,能读顶部帖子,能点第 10 条,能继续进入文章页面。
在 Google Sheets 里,他又让它去做一个研究任务:查四个模型的 API 价格——
- Claude Opus 4.6
- Sonnet 4.6
- GPT-4.4
- Gemini 4.1
然后把这些数据填进表格里。
这不是一个简单的“网页点击 demo”,而是一个完整工作流:
- 去外部网站搜索价格
- 把结果整理出来
- 回到 Google Sheets
- 自动填表
- 继续生成图表
这时候 recon 就显得非常值钱。
因为它不是让 Agent 在每一步都重新猜页面,而是先把页面空间扫描成“可操作地图”,后续动作就稳定得多。
说白了,Surfagent 的思路像是:
先给 AI 一张地形图,再让它出门。
这比“边走边猜”靠谱太多了。
Google Sheets 和 X:最实用的不是炫技,是“像人一样工作”
很多 AI 浏览器工具的演示都很像花活:
打开网页、点按钮、输入文字、截图结束。
Surfagent 的演示更接地气一点,因为它碰到的都是真实办公动作。
比如 Google Sheets。
作者让它去找几家模型的 API 定价,然后把数据写进表格里。这个场景很像现实里的研究助理、增长分析、竞品整理、销售情报收集。
你可以想象一个团队平时怎么做这件事:
- 一个人开十几个网页
- 一个人复制价格
- 一个人去 Sheets 手填
- 可能还会顺手做个图
现在这件事如果交给 Agent,至少前半段就能自动化掉。
它还有个很重要的好处:
你不一定要等对方提供 API。
这在很多平台上都很现实。价格、内容、账号状态、帖子互动、视频 transcript,这些数据本来就在网页上。
既然人能看到,为什么 Agent 不行?
X 的例子也是一样。
作者登录了自己的 x.com,然后说:去找最新关于 cloud methods 的新闻。
工具会根据页面结构去探索、切换搜索、看 latest、继续收集上下文。
最后他甚至尝试让它写一条帖子并发布。
这个场景很值得注意,因为它暴露了一个关键趋势:
Agent 不是只能“查资料”,还会慢慢进入“代替你执行公开动作”的阶段。
一旦它能稳定地浏览、搜索、写入、发布,那很多“半自动运营”都会变得很不一样。
比如:
- 监控某个话题
- 整理热帖
- 自动生成摘要
- 形成待发布草稿
- 甚至做一些轻量社媒运营
当然,视频里也很诚实地提到,这不是完美的。
但它已经能跑起来,已经能在真实站点上做事,这就比“只在沙盒里聪明”强太多了。
最值得记住的一点:它靠的不是 headless,而是“真浏览器”
视频里有个细节很重要,作者特地说了:
这不是 headless。
这意味着什么?
简单说,很多浏览器自动化工具会用无头模式,后台跑,不显示真实界面。
这样轻便、便宜、易部署,但问题也很明显:
有些网站会检测、某些交互不稳定、登录态和真实操作体验也可能出问题。
Surfagent 的思路更像是:
直接借一个真实可操作的浏览器环境,让 AI 在里面干活。
作者还提到自己有一台 Mac mini 在跑这个东西。
这就很真实了。
很多好用的 Agent 工具,最后不是卡在模型,而是卡在运行环境。
你得有:
- 一个稳定的浏览器会话
- 一个登录状态
- 一个可持续运行的机器
- 能让 AI 看到并操作页面的通道
所以这类系统的工程价值不只是“我写了个包”,而是它把 Agent 真正落进了浏览器世界。
这也是为什么他说它是 open source、可以 npm install。
当一个东西开始变成可安装的包,它才有机会被更多人拿去改成自己的工作流。
这个项目真正指向的,不是“自动化”,而是“Agent 的现实入口”
如果只看视频表面,你会觉得这就是一个浏览器自动化工具。
但如果往深一点看,它其实指向了一个更大的方向:
AI Agent 的第一批杀手级能力,不一定是写代码,而是代你跨网站干脏活累活。
这些活有几个共同点:
- 重复
- 依赖登录态
- 没有统一 API
- 需要在多个站点之间跳转
- 需要把信息重新组织成可用上下文
这正是浏览器自动化最有价值的地方。
而 Surfagent 的巧思在于,它没有试图重新发明浏览器,也没有试图做一个特别复杂的“超级代理平台”。
它先做了一件很务实的事:
让 AI 能在真实网页里先看,再拿,再写,再交付。
这就够强了。
如果你是做 AI 产品的人,这里有几个很直接的启发:
- 不要只盯着聊天能力,要想它能不能“完成任务”
- 不要总想着做 API 整合,有些场景直接读网页更快
- 不要把自动化做成死脚本,给 Agent 留空间
- 页面扫描、结构识别、任务拆解,比单点点击更重要
如果你是做创业的人,这类工具也特别值得盯。
因为它不是纯技术玩具,而是一个可以长成:
- 研究助手
- 运营助手
- 社媒助手
- 竞品监控工具
- 数据采集与整理工具
- 内部知识抓取工具
的底座。
而且作者明显已经开始想“自动化流水线”和“被动收入”那一类的事情了。
这不是随口一提,是很多 Agent 工具创业者都会走到的下一步:
一旦浏览器动作可以稳定自动化,很多信息密集型工作都能被重组。
值得记住的话
“The browser tool for AI agents.”
“We don’t really need any APIs.”
“先 recon,再操作,速度会快很多。”
“This is not headless.”
标签
AI 工具 编程 创业 案例
更多值得记住的话
**“We don’t really need any APIs.”**
**“先 recon,再操作,速度会快很多。”**
**“This is not headless.”**