← 返回教程库

「在这个榜单上排第一」和「在你账户上能赚钱」,中间隔着什么

最后更新 2026-08-19
📚 量化与 AI 投研 📖 仓库导览 · AI-Trader ⏱ 约 16 分钟 R2 · 注意风险
你将学到
  • 用「数千个参与者里必然有个第一名」这个角度,看懂名次和能力之间那个被略过的分母
  • 说得清排行榜按什么口径排就会奖励什么打法,以及为什么你只看得见幸存的那一端
  • 说得清模拟账户里被删掉的成本口径和心理资金约束,为什么恰恰是真实账户里最要命的
  • 拿到任何一份 AI 交易研究成果或排行榜截图,会先问四个问题:成交怎么算、样本期多长、干预做到哪一步、有没有报告失败

有人在群里甩了一张截图。一个榜单,第一行是某个 AI Agent 的名字,后面跟着一个很好看的收益数字,再后面是「30 天」。截图上面配了一行字:「AI 已经比大部分人会做交易了。」

群里有人问怎么参与,有人问用的什么模型,有人开始算如果拿自己的账户跟着做,一年下来能有多少。

没有人问一个更靠前的问题:这个数字是在什么条件下拿到的?

这一节就是拆这个问题。用的标本是一个公开的 AI 交易研究项目 AI-Trader——它把一堆 AI Agent 放进同一个模拟环境里,让它们发信号、互相讨论、参与排名,然后把整个过程的数据导出来做统计分析。它的价值恰恰不在结论,在于它把自己的实验记录也公开了,包括中间出的所有岔子。

先交代一下分工,免得你顺读两篇撞到同一件事上:**「这种研究方法在做什么、它的实验设计与纪律凭什么值钱、模拟盘的成交假设为什么撤不掉」,全在让几千个 AI 在同一个模拟盘里比高低那篇。本篇只干一件事:你手上有一张具体的成绩单或榜单截图,该按什么顺序给它打折扣。**这一篇不重复那一篇的机制,那一篇也不抢这一篇的分母问题。

另外说清楚:本文不评价这个项目好坏,不推荐任何模型、平台或产品,也不认为哪条路能带来收益。它在这里只是一个方便观察的标本。

科目二考满分的人,你敢不敢坐他的副驾

先离开屏幕,想一件所有人都经历过的事。

驾校里有个学员,科目二场地考试满分,倒库入库分毫不差,坡起从不溜车,教练在群里点名表扬。你会因为这个成绩,放心让他明天载你走一趟高速吗?

大概不会。你说不上具体理由,但你隐约知道哪里不对。把那个「不对」拆开,正好是三件事。

第一件,场地不是路。 驾校场地上,桩是固定的、地面是干的、没有别的车、没有电动车从右边窜出来、没有人加塞、没有大货车在你旁边压着线走。他那个满分,是在一个所有变量都被拿掉的环境里拿到的。

第二件,他只开过这段时间。 他练了两个月,这两个月没下过雪,没起过大雾,没赶上过晚高峰。不是他不行,是这些情况根本没出现过,所以没被考到

第三件,考的东西和你关心的东西不是一回事。 科目二考的是把车停进线里的精度。你坐副驾关心的是他会不会在别人别他的时候急打方向。这两样能力有点关系,但远不是一回事。

现在把这三件事原样搬到那张排行榜截图上。你会发现,一个都没少。

对你的判断意味着什么:条件比数字重要得多

大多数人看这类成果的方式是「多少」——多少收益、排第几、比人类强多少。

正确的看法是「在什么条件下」。一个数字脱离条件是没有意义的,而这类研究成果的条件通常写在最不显眼的地方,甚至根本没写。

所以你要做的动作,是把那张漂亮的截图翻过来,去找它背面的条件清单,然后逐条问自己:这些条件里,哪些在我的账户上不成立?

不成立的部分,就是你不能直接搬运的部分。搬运的时候不打折,就等于默认自己的账户是个驾校场地。

系统层一:模拟环境删掉的那两样,你不打折就会吃亏

这类项目跑的通常是模拟盘——用真实市场数据,做模拟成交。AI-Trader 的公开说明里就是这么描述自己的:新手可以用一笔虚拟资金零风险开始,Polymarket 那一块也明确写着真实数据配模拟执行。

成交这一环怎么被简化掉的——单子不进真正的撮合队列、没有滑点、没有你自己那笔单子对价格的推动——那是这种范式撤不掉的固有性质,同台竞技那篇已经把机制和它的分布特点讲完了,这里不重复。你只需要记住那篇的结论:折扣不是统一的,动手越频繁、单笔越大、标的越冷门的打法,注水越厉害。

本篇要展开的是另外两样,因为它们和你的账户挨得更近,而且几乎没人替你算。

成本口径:同一条曲线,换个费率就是另一条

手续费、印花税、点差、融资利息,每一笔都是确定要交出去的钱。

问题在于,模拟环境里这些数字是可以被配置的。可以配成零,也可以配成一个和你券商完全不同的数。你在截图上看到的那条净值曲线,它背后到底扣了多少成本,除非明写,否则你无从得知——而这类展示恰恰最爱省掉这一行。

为什么这件事的杀伤力比你以为的大?因为成本是按交易次数收的,收益却不是按交易次数产生的。一套一年动两次的方法,成本口径写不写都差不太多;一套一天动几次的方法,成本口径差万分之五,一年下来就是天壤之别。而模拟环境里跑出好成绩的,往往正是后面这一类——因为没有成本压着,反复进出不吃亏。

所以你的动作很具体:**看到任何一条曲线,先把「按我自己的费率、按它的交易频率,一年要交多少出去」这个数算出来,从收益里扣掉再看。**你自己的费率在对账单上写着,交易频率通常在展示里也能看到个大概。算完你会发现,很多好看的成绩扣完就剩不下什么了。本站手续费与印花税那篇给了具体口径,照着套一遍就行。

心理与资金的真实约束:模拟账户不会问你「钱还在不在」

这一条最容易被忽略,但它可能是所有差距里最大的一块,而且它在任何一张成绩单上都不会出现。

模拟账户跌掉三成,会发生什么?什么都不会发生。没有人问你钱还在不在,你不用追加保证金,不用跟家人解释,不用在半夜两点睡不着的时候摁住自己不去改仓位,不用在第二天早上开盘前反复告诉自己「再等等」。

真实账户里,这三成是另一回事:

  • **资金层面:**如果你用了杠杆或保证金,跌到某条线上,你的选择权会被直接拿走——不是你决定要不要止损,是系统决定。模拟盘里「扛住」是免费的,真实账户里「扛住」需要额外的钱。
  • **时间层面:**回撤最难受的不是深度,是长度。一年不回本和一个月不回本,深度可能一样,但后者你能忍,前者绝大多数人忍不了。这段时间里你还得继续生活,还得回答家人「那笔钱怎么样了」。
  • **心理层面:**人在浮亏里的判断力和在浮盈里完全不是一个人。同一套规则,你在赚钱的时候执行得一丝不苟,在连续亏了六周之后会开始「这次情况不一样」。这不是意志力问题,是所有人都这样。

结论是:**同样一条净值曲线,中间那道口子的深浅和长短,比最终收益率更能决定你实际拿到什么结果。**因为收益率是终点的数字,而回撤决定了你会不会走到终点。这件事怎么量化,见最大回撤

模拟盘把「能不能扛住」这一整个维度删掉了。**它测出来的其实是「假设有一个人绝对不会中途放弃、也绝对不会被追缴保证金,会怎样」。**这个人不存在。

所以看任何成绩单,你要多问一句:**这条曲线最难受的那段,是什么时候、跌了多少、持续了多久?如果那段发生在我身上,我当时手里还有多少现金、要不要交房租、能不能不看盘?**这个问题的答案,才是你能不能用这套东西的真实边界。

🚧 避坑

坑:把模拟盘的成绩当成能力证明。 模拟环境筛选出来的第一名,很可能恰恰是那些在真实约束下活不下来的打法——因为没有真实成本压着,高频反复进出不吃亏;因为没有追缴,敢在浮亏很深的时候继续加。怎么避:看到任何模拟盘成绩,先问三个问题——成交价怎么定的?成本按多少算的?中间最深的时候跌了多少、跌了多久?三个问题里有一个答不上来,这个成绩就先放一边。

系统层二:样本期短到只见过一种天气

第二处局限,藏在时间里。

AI-Trader 那份公开的实验记录,把整个过程按天写成了一张流水表。翻下来你会看到一件事:整个实验从建组、分配、通知、观察,前后就是几天到一两周的跨度。 而且记录自己在阶段表里标得清清楚楚——真正想验证的那几个干预(奖励机制改变、竞赛挑战、团队任务),状态一栏写的是「未开始」。

这份诚实非常值钱,因为它直接告诉你:这个项目此刻还没有得出关于「AI 能不能赚钱」的任何结论,它只是把观测的架子搭起来了。

但你从群里看到的截图不会告诉你这一点。截图只有一个名次和一个数字。

样本期短意味着什么,用驾校那个类比就够了:这段时间里市场只出现了它出现的那几种样子。 一个只在单边上涨里跑过的打法,和一个在急跌里被真正考验过的打法,在短样本上可能长得一模一样,而且前者往往更好看——因为它没有任何防守的开销。防守是一件平时只花钱、出事那天才回本的事,短样本里几乎必然吃亏。

这不是 AI 特有的问题,是所有历史检验共有的老问题。样本内和样本外为什么必须分开、分开之后又怎么被人无意中弄脏,样本内与样本外 讲得很完整。这里只补一句这类研究特有的:当参与者是一群会互相看、互相讨论的 Agent 时,「样本外」这个概念本身还会被稀释——它们在同一段行情里互相抄作业,看起来是很多个独立样本,实际上可能只是同一个判断的很多个副本。

这一点直接接到下一节:如果参与者之间不独立,那么「数千个参与者」这个分母也是虚的,真实的独立尝试次数比你数到的少。

系统层三:数千个参与者里,第一名的存在是必然的

这是全篇最反直觉、也最关键的一处。前面两节讲的是「成绩被高估了多少」,这一节讲的是更狠的一件事:这个成绩可能根本不承载任何信息。

那份实验记录里,参与实验的是一个被冻结下来的固定队列,规模在数千这个量级。也就是说,那张排行榜的下面,还压着几千个你看不见的名字。

现在做一个思想实验。假设这几千个参与者全都是纯随机下单的,一点判断力都没有,就是抛硬币决定买还是卖。一个月之后你去看排行榜,会看到什么?

你会看到一个非常漂亮的第一名。

不是「可能会」,是一定会。几千次随机试验里,总有那么几次运气特别好;而排行榜的作用,恰恰是把它们捞到最上面、把其余那几千个塞到你根本不会翻的页数里。你看到的那个数字,是几千个抽签结果里的最大值,而不是任何一种能力的度量。

请把这句话读两遍:**排行榜是一台专门挑选极端值的机器。**它的工作原理就是把分布最右边那个尾巴拎出来给你看。哪怕整个分布的中心是零、哪怕这个分布纯粹由噪声构成,它也一定能拎出一个好看的尾巴——参与的人越多,拎出来的那个越好看。

这件事的杀伤力在于,光看第一名你永远分不出它属于哪种情况:是真有本事,还是几千分之一的运气。**这两种情况在榜单上长得一模一样。**没有任何一种「更仔细地看第一名」的方式能把它们分开——你把它的每一笔交易都研究一遍也分不开,因为运气好的账户,每一笔也都是赚的。

要分开,你只有一条路:**知道分母。**一共有多少个参与者?试了多少个版本?跑了多少轮?只有拿着分母,你才能问出那个真正的问题——**如果这几千个人全都在瞎做,第一名大概会好看到什么程度?**明显超过这个「瞎做的天花板」,才轮得到讨论能力;没超过,那个数字就是噪声。

而分母这个东西,在 AI 参与之后会以你想不到的方式膨胀:一个人一晚上可以试几百个参数组合,几百个 Agent 又可以各试几百个。用 AI 跑出一条漂亮曲线,不等于 AI 有效 那一节把分母藏身的几个地方全翻出来了,值得配着这一节读。同一个机制在传统量化里的名字叫数据挖掘偏差——比得越多,撞上一个漂亮结果的概率越高。

排行榜按什么口径排,就会奖励什么打法

上面说的是分母,这一小节说的是分子被谁挑出来的。这一层更隐蔽,因为它不是统计噪声,是激励。

排行榜必须按某个口径排序。而它按什么排,就会系统性地把某一类打法推到榜单两端。

最常见的口径是收益率。按收益率排,会发生什么?

**下重注、不分散、赌单一方向的打法,会同时占据榜首和榜尾。**这是数学上的必然:把全部资金压在一个标的一个方向上,结果分布的方差最大,所以它既最容易冲到最上面,也最容易沉到几千名开外。而分散、控制单笔权重、留着仓位不满的打法,方差小,它几乎不可能进前十——它也几乎不可能垫底,但垫底那一页你不会翻。

于是你打开页面,看到的是一整屏「重注押对了」的人,得出的印象是「这么干能行」。你看不见的是同样一批打法里输掉的那大多数,他们在你不会滚动到的地方。这个偏差的完整长相,见幸存者偏差

换个口径,被奖励的打法立刻就变。按夏普比率排,稳的那一类会浮上来,但赌波动率、在平静期反复收小钱的打法会占便宜——它平时曲线极平滑,出事那天一次性还回去,而那一天可能还没到。按胜率排,那么「小赚很多次、大亏一次」的打法会霸榜。没有一个口径是中立的,每个口径都在替你定义什么叫好。

所以看到任何榜单,先问一句:**它是按什么排的?这个口径系统性地偏爱哪种打法?我要的是那种打法吗?**这一问经常比研究榜首那位具体做了什么更有用。

有意思的是,认真做研究的人自己知道分母这回事——他们会主动上一套统计手段给自己的结论打折,这一点 同台竞技那篇 的实验纪律里说过,不重复。

对拿到榜单的你来说,它只有一个用处:研究者已经替自己打过的折,转发截图的人不会替他打。所以你看到一张干净的排行榜时,第一件事是回去找原始研究里那些打折的说明——找得到,这份成果的可信度就高一档;找不到,那你手上这张榜就只是一张榜。

那到底怎么读这类成果才不被误导

上面三条讲的是局限在哪儿。这一节讲你拿到东西之后的具体动作:四个问题,按顺序问,任何一个问不出答案就停下。

一问:成交是怎么算的,成本按多少扣的? 模拟执行还是真实成交?费率是多少?如果一份成果连这个都不写,它就不是一份可以拿来对比的成果,只是一张海报。这一问淘汰掉的东西,比后面三问加起来还多。

二问:样本期有多长,覆盖了什么? 不是问「跑了多少天」,是问这段时间里市场经历过什么。有没有一段急跌?有没有一段横盘磨人的时候?如果这段时间只有一种天气,那这个成绩说明的只是「它在这种天气里没翻车」。

三问:分母是多少,干预做到哪一步,结论是谁下的? 一共几个参与者、试了几个版本,是判断名次含金量的前提。同样重要的是:很多时候原作者根本没有下结论——像 AI-Trader 那份记录,作者老老实实写着核心阶段「未开始」。结论是转发的人替它下的。 你花两分钟去翻一眼原始说明,经常会发现原作者比转发者谨慎十倍。

四问:它有没有报告失败? 这一问的信息量最大,值得单独说。

那份实验记录里有一整节叫「问题与修复」,里面写的全是不好看的事:接口大面积超时,导致那几天的活跃度数据被服务器的稳定性污染,研究者自己标注说这段时间的读取相关指标不可信;有三百多个新注册的参与者一开始漏了分组,其中几十个在补齐之前已经产生了没有标签的数据;某次群发因为上限设置,覆盖不全,得重来。

一份愿意把这些写下来的记录,比一份只有漂亮结论的报告可信得多。 不是因为它做得更好,恰恰相反——是因为它让你有机会判断哪些数字不能用。而一份从头到尾没有任何「这里出过问题」的展示,你连它哪里可能出问题都无从下手,它的信息量是零。

所以这一问可以直接变成一条筛选规则:先去找失败记录。找不到,就当没看过。

⚠️ 风险提示

这一节讲的是怎么读研究成果,不是怎么跟。任何把排行榜名次、模拟盘收益直接当成下单依据的做法都很危险:名次里混着运气,模拟环境里没有成本、没有滑点、没有追缴保证金,也没有你半夜睡不着的那一刻。如果你在考虑把资金交给任何自动化的东西执行,先去读 从一个跑得通的 demo 到真能用,差的是什么——那里讲的是工程上必须补齐的东西,和本节讲的研究局限是两回事,两样都缺一不可。本站只讲机制与风险,不推荐任何模型、平台或产品,也不提供任何自动交易方案,边界见 免责声明

这类成果真正值钱的地方在哪

说了这么多局限,容易滑向另一个极端:那这些研究是不是就没用了?

不是。它们的价值只是不在你以为的那个地方——而且这个价值有很具体的两条,你今天就能用。这两条都不是「实验设计」层面的方法论(那部分在同台竞技那篇),而是关于你怎么对待自己手上那份记录

第一条:如实记下中途出的岔子。 上面那节「问题与修复」,请你当成一面镜子照自己。它记录的那些事——某段时间数据不可信、一部分记录漏了标签、某次操作覆盖不全——你自己复盘的时候一样会遇到,区别只在于你有没有记下来。

今天就能做的动作:**在你自己的复盘文件最后加一节,标题就叫「这次哪里不对劲」。**这周你手动改过哪笔单、有哪天数据是补的、有没有哪次因为出门没盯盘导致规则没执行——不评价,只记录。三个月后回头看,你会发现自己的结论里有一半要重新掂量,而这一半你原本永远发现不了。

第二条:导出数据时把敏感字段清掉。 那条流水线在把平台数据整理成公开数据集时,会先做脱敏。这个动作看起来只是合规义务,但它对你个人有另一层意义。

今天就能做的动作:**如果你打算把自己的记录发给别人看、发到群里、或者交给任何一个外部工具去分析,先做一遍脱敏——账号、资金总额、真实持仓规模,全部去掉,只留比例和相对数。**这不只是防泄露:把绝对金额去掉之后,你自己看那份记录的心态也会变——你会开始看比例和结构,而不是盯着那个让你心跳加速的数字。很多人复盘复不下去,就是因为一打开就看见钱。

这也是我对这类项目的看法:把它当方法的展品看,别当结论的来源看。 你从它身上真正能带走的,是「我以后看任何一份成果,先翻它的条件、分母、样本期和失败记录」这个习惯。这个习惯不依赖任何一个模型、任何一个平台继续存在。

而排行榜上那个数字,换一段行情就不成立了。

小结

  • **数千个参与者的排行榜上,第一名的存在是必然的,哪怕所有人都在随机下单。**排行榜是一台专门挑选极端值的机器。你看到的是几千个抽签结果里的最大值,不是能力的度量——要区分开,你必须知道分母,然后问「如果全在瞎做,第一名会好看到什么程度」。
  • 排行榜按什么排就奖励什么:按收益率排,就会把「下重注、不分散」的打法同时推到榜首和榜尾,而你只看得见幸存的那一端;换成夏普、换成胜率,被奖励的打法立刻就换一批。没有中立的口径。
  • 成本口径可以被配成零、也可以和你的券商完全不同。成本按交易次数收,收益不按交易次数产生,所以动手越勤的方法,成本口径写不写差别越大——先按自己的费率算一遍再看收益。
  • 模拟账户不会追缴保证金、不会让你半夜睡不着。它测出来的是「假设有个人绝不中途放弃、也绝不被强制平仓,会怎样」,而这个人不存在。中间那道口子的深浅和长短,比终点的收益率更决定你实际拿到什么。
  • 读这类成果的四个问题:成交与成本怎么算、样本期覆盖了什么、分母多大且结论是谁下的、有没有报告失败。第四问最省事——先找失败记录,找不到就当没看过
  • 能被你带走的两条动作:复盘文件里加一节「这次哪里不对劲」;把记录拿给任何人或任何工具之前先脱敏,只留比例。

一句话记住这篇:在一个没有风、没有雨、撞了不疼的场地上跑出第一名,说明他会在那个场地上跑;至于路上会发生什么,那张成绩单一个字都没提。

本文所述内容均来自上述公开说明与实验记录的阅读,是对文档的复述与解释,不是运行结果,也不构成对任何模型、平台或产品的推荐。回 量化与 AI 投研概念库 看各个概念在说什么;本站内容为投资教育,不构成任何投资建议。

内容有错、看不懂、或想看下一篇?告诉我们 →

本文为投资教育整理,不构成任何投资建议;不荐个股/基金、不预测点位、不承诺收益。关键数据与结论请结合权威来源自行验证,并见风险免责声明