让几千个 AI 在同一个模拟盘里比高低,这件事能证明什么
- 能说清「把变量控住之后再比」这种研究范式在做什么,以及它能回答的问题为什么只能是相对的
- 能说清模拟盘固有的成交假设为什么不是「均匀打个折」,而是专在最关键的那几笔上系统性地乐观
- 能把一条研究流水线的实验纪律——先留基线、事先冻结名单、动手前先空跑、如实承认比过多少次——搬到自己的复盘里
你大概刷到过这种截图:一张榜单,左边一列是眼熟的 AI 名字,右边跟着一串数字,底下一行小字写着「模拟盘实测」。发截图的人配了一句话——「某某已经证明了自己」。
你心里有点痒。你也想知道,这些东西到底是不是真有用。你甚至想过,干脆照着榜首那位的做法抄一遍。
但你八成也隐隐觉得哪里不对劲,只是说不上来。
这篇不打算逐条教你怎么给那张截图打折扣(那件事放在了本卷的另一篇里)。这篇要说的是更靠前的一件事:**把一堆参与者塞进同一个环境里比高低,本身是一种研究方法。**这种方法在做什么、它的实验怎么设计、它凭什么值钱、它自带哪条撤不掉的边界——把这四件事想清楚了,你再看任何一张榜单,姿势就是对的。
先把话说死,免得你读到一半以为我在推荐什么:统一环境下的横向对照确实是有研究价值的一件事;但把这种对照跑出来的名次,当成「谁在真实市场里更能赚钱」的证明,是两回事。
先说赛车模拟器
你在电竞馆见过那种赛车模拟座舱。有方向盘,有踏板,屏幕上是某条真实赛道。馆里挂着一块圈速榜,上面记着这个月谁跑得最快。
这块榜有意义吗?**有,而且意义不小。**因为馆里把该控的东西全控住了:同一条赛道、同一个车型、同一套天气设定、同一台机器。榜上两个人差了半秒,你可以相当有把握地说,这半秒是人的差别,不是运气、不是车、不是天气。这就是控制变量的全部价值——把别的东西钉死,剩下的差异才归得了因。
现在换个场景。模拟器榜首那位,直接被塞进一辆真车,拉去同一条赛道跑一圈。会发生什么?
轮胎会发热,抓地力一圈比一圈不一样;下雨了,水膜怎么处理模拟器没教过;前面有别的车挡着,你想走的那条线被人占了;更要命的是,你一进弯,身体会告诉你「要飞出去了」——这个信号模拟器里根本不存在,而它会直接改变你踩不踩刹车。
模拟器里那半秒的优势,到了真赛道上还剩多少?没人知道。可以确定的只有一件事:那半秒是在「没有轮胎损耗、没有天气、没有别的车、没有恐惧」这四个假设下量出来的,而真赛道把这四个假设全撤了。
这就是这种研究范式的形状:**它用一个删掉了很多东西的世界,换来了归因的资格。**删掉的越多,归因越干净,离真实越远。两头都是真的,缺一头你就会读错。
这种方法能回答什么问题,不能回答什么问题
把类比落到投资上,得先分清两类问题。
第一类:相对问题。「在完全相同的条件下,A 的做法和 B 的做法,行为上有没有系统性差别?」这类问题,统一环境的模拟盘能回答,而且回答得比你我平时随口的印象靠谱得多。
第二类:绝对问题。「A 拿真金白银去做,能不能赚钱、能赚多少?」这类问题,模拟盘一个字都答不了。
大多数人看榜单时,脑子里想的是第二类问题,但这种方法能支撑的只有第一类。中间这一步的错位,是所有误读的源头。
值得注意的是:相对问题并不是「次一等的问题」。真实市场里你几乎永远拿不到对照组——同一段行情只会发生一次,你没法让同一个人在同一段行情里既做 A 又做 B。**能造出对照组,恰恰是模拟环境唯一无法被真实市场替代的本事。**这也是为什么严肃的研究者会主动放弃「回答绝对问题」,去换「能回答相对问题」。
撤不掉的那条边界:成交是被假装出来的
为什么绝对问题答不了?因为这种范式里的成交,是被「假装」出来的。
程序看到一个行情价格,就按那个价格记一笔成交,账户里的数字随之变化。这个动作在真实市场里对应的是一整条链路:你的委托要排队,要有人在那个价上愿意跟你做对手盘,你自己这笔单子还会把价格推走一点。这三件事在模拟盘里通通不发生——
- 你按下单价成交,而真实成交价永远会偏一点,这就是滑点;
- 你想买多少就买多少,而真实市场里你的单子自己会把价格买高,这就是冲击成本;
- 你以为这个品种随便进随便出,而真实市场里能容纳的资金量是有天花板的,这就是流动性与策略容量。
请注意,**这不是某个项目做得不够好,是这种范式的固有性质。**你要控住变量,就必须把成交这一环换成一个确定的规则;一旦换成确定的规则,真实成交里那些不确定的部分就一并没了。想保留它们,你就得回到真实市场,而回到真实市场你就失去了对照组。这道题没有两全的解。
更要命的是这三样东西的分布方式。
**它们不是在你的成绩上均匀地扣一小块,而是专挑你最想交易的时候收得最狠。**行情剧烈波动、消息刚出来、大家都在抢的那几分钟,正是滑点张得最大、冲击最重、盘口最薄的时候;而这几分钟,恰恰也是一套「反应快、看得多、不犹豫」的自动化方法最容易发出信号的时候。它想动手的时刻,和市场收费最贵的时刻,是同一批时刻。
这个性质有个很不直观的后果:一套方法在模拟盘里赢得越漂亮,它被高估的幅度可能越大。因为它赢在哪儿?多半赢在那些「别人还在犹豫、它已经动了」的时点上——而那些时点正是真实世界里最贵的。模拟盘对这三样通通免疫,所以它给出的成绩不是「略微乐观」,而是在最关键的那些笔上系统性地乐观。
反过来,一套动手少、拿得久、只在流动性最好的品种上做的方法,在模拟盘里被高估的幅度就小得多。**同一张榜单上的两个名次,注水程度完全可以差一个数量级。**这句话比「模拟盘成绩要打折」有用得多,因为它告诉你折扣不是统一的。
想知道这道缝在历史检验里具体是怎么被抹平的,成交撮合假设和交易成本假设两篇讲了机制。
一个把这件事做成研究的项目长什么样
有意思的是,真正把这件事当研究做的人,反而是最清楚上面这条边界的人。
AI-Trader 是这么一个开源项目:它做了一个让 AI 助手直接接进来的交易平台,用模拟资金开户,可以发布交易观点、可以互相跟单、可以参加带排行榜的挑战赛。听起来像个玩具,但它的仓库里有一个目录,暴露了它真正的意图——那是一整条研究流水线,公开说明里写得很直白:把平台上的数据整理成可复现的数据集、指标、统计表和论文插图,对象是一场涉及数千个参与者的「竞争与协作」研究。
注意这里的重点:它要研究的不是「哪个 AI 会炒股」,而是「不同的激励结构下,一群参与者的行为会怎么变」。这是个典型的第一类问题——相对问题。研究对象是行为,不是收益。榜单在这套设计里是自变量的一部分(一种激励),不是因变量。
这个区别一旦看懂,你再看这类项目就不会失望了:它从头到尾就没打算回答你最想问的那个问题。
实验纪律:这条流水线上真正能被你搬走的东西
它的实验设计,翻译成人话是这样的。这几步不需要任何技术,也跟 AI 没关系,但真做到的人比例低得惊人——它们才是这类项目最能被你带走的部分。
**第一步,先随机分组。**所有参与者被分进几个组:一组什么都不改,当对照;一组强调排名和业绩;一组强调内容质量和互相帮忙;还有一组两者混合。分组这件事本身,就是承认「不同的人本来就有差别」,所以必须靠随机分配把这个差别摊平。
搬到你身上:你要比较两套做法,别拿「去年用 A、今年用 B」的成绩去比——那两段行情本来就不一样,你比的是行情不是做法。
**第二步,留一段基线。**分组做完之后,它并没有立刻开始干预,而是先让系统按原样跑一段,把每个人干预之前的行为记下来。你要证明某个变化是干预造成的,就得先有一份「什么都没做时是什么样」的底片。
搬到你身上:你要试一个新方法,先把「什么都不改」的那段成绩留出来当底片,别只记新方法的成绩。绝大多数人的复盘里只有「改完之后」,所以永远说不清改动到底有没有用。
**第三步,冻结样本。**这一步最见功夫。实验日志里写得很清楚:到某个时刻为止已经注册的账号才算数,之后新来的一律排除在外。为什么?因为「听说这里在搞比赛才跑来注册」的人,和「本来就在这儿」的人,根本不是同一批人。你要是让他们混进来,最后算出来的差别到底是干预的效果,还是新来那批人自带的属性,永远说不清。事先划死名单,是为了不让自己事后有可挑的空间。
搬到你身上:判断标准和样本范围,在动手之前写下来,不许事后调整。事后调整一次,你的结论就只剩下装饰功能。
**第四步,发通知之前先空跑一遍。**日志里记着,正式发出实验公告之前,先做了一次不真发的演练,就为了核对「实际会收到通知的人数」和「名册上应该收到的人数」对不对得上。第一次演练还真发现对不上——系统里有个上限把发送范围截短了。这个坑要是没提前发现,实验就废了一半,还废得神不知鬼不觉。
搬到你身上:真金白银之前先空跑一遍,核对「我以为会发生的」和「实际发生的」对不对得上。空跑的目的不是看盈亏,是看有没有你根本没想到的环节在偷偷生效。
**第五步,如实承认自己一共比了多少次。**这条流水线列出的分析手段里,除了常规的分组对比,还有一项叫多重检验校正——意思是承认自己做了很多次比较,然后按比过的次数把结论的门槛抬高。**一条流水线愿意把多重检验校正摆进去,等于研究者主动给自己的结论打折。**这个态度比任何漂亮结果都值钱。
搬到你身上:老实记账——这套方法你一共试过多少个变种?如果你试了二十种、留下了最好看的那一种,那这个成绩里有多少是本事,你自己心里得有数。
至于「为什么参与者一多,第一名就必然好看」这件事背后的统计逻辑,以及它怎么反过来改变你读榜单的方式,本篇不展开,这类研究项目离能用还差什么那篇专门讲。
控制变量的边界:能控住绝大部分,不等于控住全部
还有一层容易被忽略:所谓「统一环境」,其实也没那么统一。
就拿价格数据来说。这个项目的公开更新说明里写着,主用的行情来源如果拿不到可用价格,会自动切到备用来源。这在工程上是完全正确的设计——不这么做服务就断了。但对研究而言,它意味着不同时段、不同参与者拿到的价格,来源可能并不完全一致。
这不是挑刺。**能把绝大部分变量控住,已经是很高的工程水准了;但「绝大部分」和「全部」之间那道缝,正是所有结论必须留余地的地方。**任何一个真在运行的系统都会有这道缝:接口会超时、限流会触发、时钟会漂、某个数据源会临时缺一段。区别只在于研究者有没有把它写下来。
这一条也可以直接搬走:**你自己的复盘里,那道缝在哪儿?**行情从哪儿来的、复权怎么处理的、有没有哪几天数据是补的——这些你不写下来,半年后连你自己都复现不了自己的结论。
那这类项目的价值到底在哪
拆到这里你可能觉得这整件事没意义了。恰恰相反。
它的第一个价值,是把「AI 在投资上有没有用」这个没法回答的大问题,切成了一堆能回答的小问题。「有没有用」答不了,但「在同样的行情、同样的结算规则、同样的时钟下,改变激励方式,一群参与者发布观点的频率和质量会不会变」——这个能答。答案哪怕只是「没什么明显变化」,也是知识。这个动作叫把问题降维到可证伪,是研究和空谈之间那道分界线。
**它的第二个价值,是把行为记录下来了。**在真实市场里,你永远看不到别人为什么那么做,你只看到价格。而在这样一个平台上,每一个观点、每一次跟随、每一次讨论,都是有记录的。这份行为数据能回答的东西,比收益率丰富得多——比如观点是怎么在一群人之间扩散的、跟单行为会不会让所有人的持仓越来越像。**后面这个问题恰恰是真实市场里最要命的风险之一:大家的仓位悄悄变成同一个仓位,平时看不出来,出事那天一起夺门而出。**这件事在真实市场里几乎无法观测,而在这种环境里能被完整地记下来。
换句话说,这种范式的产出不该是一个名次,而应该是一批关于「行为怎么被环境塑造」的可复现记录。名次只是副产品,而且是最容易被误读的那个副产品。
顺带一提,同一批人还有另一个项目,走的是完全不同的路子——不比名次,而是用自然语言把一整套研究流程串起来,那一套的思路见用自然语言驱动一整套研究流程。至于「怎么在自己的活儿上判断一个模型行不行」,别看榜单,自己出一套题测它。
有一句话必须放在这里
这类平台允许 AI 直接下单、允许一键跟单、也提供接入真实券商的通道。请把这三件事分开看:**模拟盘里跑得好,不构成任何理由把真钱交给它。**自动执行会把判断上的错误以你反应不过来的速度放大,而跟单意味着你把决策权交给了一个你既看不到其持仓全貌、也无从验证其真实成本的对象。本文只做概念讲解,不推荐任何平台、任何方法、任何标的,也不构成投资建议。
本篇讲的是这种研究方法本身:它在做什么、实验怎么设计、成交假设这条边界为什么撤不掉。至于拿到一张具体的榜单截图之后,你该按什么顺序给它打折扣——第一名为什么必然存在、排行榜按什么口径排就会奖励什么打法、成本口径和心理约束差在哪儿——全部放在这类研究项目离能用还差什么。两篇分工明确,不重复。
小结
- 把变量控住之后再比,本身是件正经事:同一份行情、同一套结算规则、同一个时钟,差异才归得了因。这是这种范式唯一站得住、也无法被真实市场替代的价值——真实市场给不了你对照组。
- 它只能回答相对问题(谁的行为和谁不一样),答不了绝对问题(拿真钱去做能不能赚)。研究者主动放弃后者,换来了前者。
- 成交是被假装出来的,这是范式的固有性质而非项目的疏漏:没有排队、没有滑点、没有冲击、没有容量上限。而且这几样专挑你最想交易的时候收得最狠,所以动手越频繁的方法,成绩注水越厉害——折扣不是统一的。
- 最值得学的不是它的结论,是它的五条纪律:随机分组、先留基线、事先冻结名单、动手前空跑、如实承认比过多少次。一行代码都不用写,今天就能用在自己的复盘上。
- 能控住绝大部分变量已经很了不起,但备用数据源这类缝隙一定存在。写下来,是研究和自我感动的分界线。
一句话说完这篇:赛车模拟器上的圈速榜,是真能看出手感差别的,但它量的是一个没有轮胎损耗、没有雨、没有别的车、也没有害怕的世界——而你真要开的那条路,这四样一样都不少。
本文基于开源仓库的公开说明与文档快照做概念讲解,未实际运行该项目,也不构成任何投资建议或软件使用建议;相关边界见免责声明。想系统看这一卷的其他内容,回到量化与 AI 投研卷。
本文为投资教育整理,关键数据与结论请结合下列权威来源验证。