← 返回拾句全部内容

用 AI 自己研究 AI 交易:Karpathy 的 Autoresearch 被我搬到了 Polymarket 机器人上

YouTube2026-06-14

摘要

把“让 AI 自己做研究”的框架,接到一个比特币涨跌套利机器人上,效果竟然真的能跑通。

"So basically, GitHub provides scope for that part to evolve the code and the research memory."

深度解读

用 AI 自己研究 AI 交易:Karpathy 的 Autoresearch 被我搬到了 Polymarket 机器人上

一句话总结:把“让 AI 自己做研究”的框架,接到一个比特币涨跌套利机器人上,效果竟然真的能跑通。


内容概览

  • 主题:AI 自主研究、Polymarket、套利交易、自动化实验、GitHub 工作流
  • 适合人群:做 AI 工具、量化交易、自动化实验、AI 编程,或者想看“AI 怎么自己改进自己”的人

核心观点

  1. Autoresearch 不只是做模型训练,也可以做策略进化 这次实验不是拿 nanoGPT 训练文本模型,而是把 Karpathy 那套“自动研究”流程搬去优化交易 bot。AI 不再只回答问题,而是自己提出实验、跑实验、看结果、决定保留还是丢弃。

  2. 真正有价值的不是单次预测,而是持续迭代的实验框架 这个系统最像的不是一个“聪明模型”,而是一套会自我更新的研究流水线。每一轮实验都把结果写回历史,让下一轮实验带着更多上下文继续试。

  3. 低风险套利最适合拿来测试这种自动化研究系统 作者选的是 Polymarket 的比特币五分钟涨跌市场,做的是接近“买两边合计低于 1 美元”的套利。因为目标足够明确,AI 的改进能不能带来收益,一眼就能看出来。


深度解读

这不是“让 AI 写代码”,而是“让 AI 学会怎么做研究”

这个视频最有意思的地方,不是机器人赚了 2 美元。那只是结果。真正值钱的是背后的方法:作者把 Karpathy 的 Autoresearch 思路,迁移到了一个现实世界的交易 bot 上。

原来的思路大概是:
AI 不是一次性给你一个答案,而是自己进入一个循环——提出假设、生成实验、运行、评估、保留或丢弃。
这听上去很像科研人员干的活,只不过换成了机器在做。

作者看到这个思路后,马上想到:既然能让模型自己研究模型,那能不能让它自己研究交易策略?

他选的不是股票,不是期货,而是自己已经在跑的一个 Polymarket 套利 bot。这个 bot 的任务很朴素:在 Polymarket 的比特币五分钟涨跌市场里,找出上下两边价格加起来低于 100 美分的机会。
比如一边买 up 45 美分,另一边买 down 54 美分,总价 99 美分。只要最后结算时两边总共能兑付 1 美元,就能赚 1 美分。

这听起来很小,但它有个巨大优势:

如果你真的找到了稳定套利,理论上胜率不是“尽量高”,而是“接近必然”。

所以这类问题特别适合做 AI 自动研究。不是让模型猜涨跌,而是让它判断:什么样的规则,更容易找到真套利。


这套系统的核心,不是模型,而是“研究流程”

作者把整个系统拆成了三部分。

第一部分是 GitHub 里的代码仓库
AI 不只是读代码,它还会在 repo 里直接演化策略。每次实验都能产出新的 commit,相当于把研究记录和代码历史绑在一起。这样做的好处很直接:你不是在看一堆临时试验,而是在看一个可追溯的策略进化过程。

第二部分是一个叫 training program.md 的 markdown 文件。
这不是普通说明文档,而是研究 playbook。里面定义了:

  • 怎么选实验
  • 怎么跑实验
  • 怎么评估结果
  • 什么情况保留
  • 什么情况丢弃

换句话说,作者不是让 AI 自由发挥,而是先给它一套“研究纪律”。
这点很关键。很多人喜欢说“让 AI 自主探索”,最后往往探索成一锅粥。真正能落地的自动研究,一定得有规则。AI 可以聪明,但流程不能乱。

第三部分是 Polymarket 的真实环境
这相当于实验场。实验不是在纸上算,不是在回测里自嗨,而是在一个真实但用 dry mode 跑的环境里测试。作者明确说了:

  • 测试阶段不花真钱
  • 每个 run 大约跑 1 小时
  • 每个窗口结束后自动评估
  • 如果实验表现差,就丢弃
  • 如果看起来强,就做一次确认测试,因为 Polymarket 数据很噪声

这里最像科研的地方,是“确认步骤”。
这很像实验室里做重复验证:第一次结果好,不代表真好,尤其在噪声很大的市场里。作者的策略不是“看到一个好结果就高兴”,而是再试一次,防止误判。

这就把整个系统从“自动化脚本”提升到了“自动化研究”。


一小时一轮,像研究员在值夜班

视频里最有画面感的一段,是 dashboard 上的实验循环。

作者说,每一轮实验大概 1 小时。
开始后,系统会记录运行状态,比如 uptime、已经经过了多少窗口、做了多少笔交易、fill rate 怎么样、score 怎么样。

他提到一个细节:
前面跑了 37 分钟,已经过了 8 个窗口。
每个窗口是 5 分钟,所以 8 个窗口就是 40 分钟。
期间做了 4 笔交易,fill rate 只有 50%。

这个 fill rate 不高。
但这恰恰暴露了问题:不是所有“看起来有套利”的机会,都真的能顺利成交。市场是会滑点的,订单也未必能完整填充。
换句话说,套利不是算出来就结束了,成交质量本身就是策略的一部分。

这也是 AI 自动研究最有现实感的地方。
如果你只是让模型优化一个纸面指标,它很容易学会“刷分”。
但一旦把执行层也纳入评估,模型就得面对真实摩擦:延迟、噪声、未成交、价格跳动、恢复余额的流程。

作者在视频里还展示了 experiment history。
每次实验都有 commit,有 evaluator,有 score,有图表。
某些实验被标记为 discard,说明策略没有继续保留。
有些实验则被 keep,因为它们在某个指标上表现更好。

你会发现,这套系统其实非常像一个自动化实验室:

  • AI 提出新的假设
  • 系统跑真实测试
  • 评分器给结果
  • 研究记忆被更新
  • 下一轮实验带着前面的结论继续

这才是 Karpathy 这类思路最有杀伤力的地方。
它不是单点能力,而是 闭环能力


真正的“研究”是让 AI 会放弃错误方向

作者在视频里试了几个方向,其中一个关键点是:实验不是一直加码,而是会主动舍弃。

比如他提到,有些实验一开始看起来还行,但最终被判定为 discard。
原因包括:

  • fill rate 太低
  • 指标没有明显提升
  • 某些过滤器没带来更好的边际收益
  • 噪声太大,结果不稳定

然后系统会根据历史结果,自动转去下一条研究方向。
他举的一个例子是:从 asymmetry filters 切到 spread relative to edge filters

这类术语听上去很硬,但意思其实不复杂。

  • asymmetry filter:看市场两边是不是有不对称的机会
  • spread relative to edge filter:看价差和你预估的优势相比,是否真的值得下手

把它翻成大白话就是:
不是“看起来能赚”就上,而是要看“赚到的钱,够不够覆盖风险和摩擦”。

这一步很重要。
因为很多自动交易系统死就死在这里:它能发现一堆“理论套利”,但真正能落地的很少。
而 AI 自动研究如果只会放大信号,不会淘汰垃圾思路,最后只会越跑越乱。

作者的系统至少做对了一件事:
它允许 AI 自己试,也允许 AI 自己承认“这条路不行”。

这很像一个成熟研究员的气质,而不是一个只会硬冲的脚本。


从 dry mode 到 live trading,实验一下子变得真实了

前面的实验都在 dry mode 里跑,不花真钱。
但视频后半段,作者切到了 live dashboard,余额大概在 150 美元附近,开始实盘测试。

他先把 package price 设成 5 美元,再启动 bot。
然后就出现了几个很有意思的交易窗口。

第一笔交易后,余额从 150 变到 146 左右。
作者说,这笔交易的 edge 大概是 0.01 左右,意思是单笔利润很薄。
但套利本来就是这样,单笔小,靠频次和稳定性吃饭。

接着他等窗口结束,系统自动 resolve,余额又回来了。
这说明这个闭环是能跑的:
买入、等待、结算、补回余额、继续下一轮。

随后他又做了几笔交易,其中一笔落在 97 美分附近。
这就更有意思了。
因为如果你买两边总共只花 97 美分,结算能拿回 1 美元,那单笔毛利就变成了 3 美分。
在小额测试里看起来不起眼,但如果这个结构稳定,放大后意义就完全不同。

视频里还有一个很真实的细节:
作者不是每次都完全确定发生了什么。
有时他会说“我不太确定怎么回事,但看起来它成功了”。
这反而特别真实。真实市场里,系统经常会比人先动一步,尤其是自动化 bot。你只能从余额变化、PnL、trade status 去反推发生了什么。

这段最有意思的结果,是他最后跑出了一组 5/5 全胜 的交易。
余额从 150 左右一路回到 152。
也就是说,大约赚了 2 美元。

2 美元不大。
但意义不在金额,而在证明:
一个由 AI 驱动的研究闭环,确实能在一个真实交易场景里,筛出更好的策略方向。

这比“AI 帮我写了个 bot”高级得多。
后者只是写代码。前者是在做持续优化。


这类系统以后可能会越来越像“自动研究员”

如果你把这个视频当成一个小玩具,就会低估它。
它真正展示的是一种很可能会变得越来越常见的工作方式:

  1. 人先定义问题域
  2. AI 负责提出实验
  3. 系统自动跑测试
  4. 结果写回知识库
  5. 下一轮继续

这个模式特别适合:

  • 量化交易
  • 广告投放优化
  • 推荐系统参数调优
  • AI agent 策略搜索
  • 工程性能调参
  • 各种“有目标、有反馈、有噪声”的问题

它最大的价值不是“AI 能不能替代人”,而是:

人类不必亲自盯着每一次试错了。

你可以把研究目标、评估标准、约束条件先定义好,然后让 AI 帮你穷举更多可能性。
人负责判断方向,机器负责把实验跑起来。

但这套方法也有明显边界。
它对一个前提要求很高:评估函数必须靠谱
如果你给错了评分标准,AI 就会优化错方向。
如果你的数据太噪,或者执行成本太高,系统会学会一些看似聪明、实则没用的东西。

所以这类系统不是“让 AI 自己变强”这么简单。
更准确的说法是:你在设计一个会自我迭代的试验台。

Karpathy 的 autoresearch 之所以迷人,就在于它把“研究”这件事从人的手工劳动,变成了机器可循环执行的流程。
而作者把它搬到 Polymarket 交易 bot 上后,给了它一个很现实的检验:不是跑分,不是 demo,而是真实市场里的小额套利。

这就很有意思了。
因为你会突然意识到,AI 的下一个阶段,也许不只是“回答得更好”,而是“做实验做得更像样”。


值得记住的话

"So basically, GitHub provides scope for that part to evolve the code and the research memory."

"The training program defines the experiment logic and how we should do the experiments."

"I wanted to see if this autoresearch project could improve the model."

"We made $2 in like about ten minutes."


标签

AI 工具 编程 创业 案例

更多值得记住的话

"The training program defines the experiment logic and how we should do the experiments."
"I wanted to see if this autoresearch project could improve the model."
"We made $2 in like about ten minutes."