那些晒出来的 AI 战绩,是怎么被做成好看的样子的
- 说清五种常见展示手法各自在数学上哪一步失效,不靠「感觉像骗人」而靠能自己复述的推理
- 拿到任何一份 AI 战绩展示,能当场问出五个把它逼回原形的问题
- 分清「回测曲线」「模拟盘记录」「真实成交流水」三种材料的证据分量差在哪
群里有人甩了一张图。图上是一条从左下角爬到右上角的曲线,旁边一行小字写着「AI 选股模型,近半年」。下面跟了几张对话截图:某天模型说了某只票,第二天那只票涨了。再下面是一句「免费群名额还剩几个」。
你心里大概有个直觉:不太对劲。但要是让你说出哪儿不对劲,你多半只能说「感觉像割韭菜」。这句话的问题在于,它是个态度,不是个判断——下次换一个人、换一套更精致的图,你的态度还是那句,你还是分不清哪张图是真的哪张是做出来的。
所以这一节不谈动机。我们只做一件事:把这几种常见的展示手法,拆到算术层面,看清它们各自在哪一步失效。 手法本身是中性的,同一个动作可能出于精心也可能出于疏忽,我们不评价人,只看数字站不站得住。
需要先说明的是:本站不荐股、不推荐任何服务、也不评价任何具体产品或个人。下面出现的全是手法的一般形态,不指向任何对象。
先说一件跟股票无关的事
有个流传很久的邮件把戏,是这么玩的。
某人给一万个陌生人发邮件。给其中五千人写「下周某个东西会涨」,给另外五千人写「下周会跌」。一周后,总有五千人收到的是说对了的那封。他把说错的那五千人扔掉,只对剩下的五千人再发一轮,还是一半说涨一半说跌。再一周,有两千五百人连着两次都收到了说对的。
这么做五轮,还剩三百来人。在这三百人眼里,发件人连着五次全说对了。他们没有任何理由怀疑——他们各自的经历是真实的,邮件是真的,行情也是真的,没有一个字造假。
关键在于:这三百人看不见另外九千七百人。他们能看见的样本,是被筛过一遍的样本。整个把戏里没有一句假话,全部的力气都花在了「你能看见谁」上。
把这个故事记牢,因为下面五种手法,本质上都是它的变体:不是在数字上动手,是在你能看见哪些数字上动手。
这对你意味着什么
对你的决策来说,这件事的后果比「被骗钱」更麻烦一点。
你决定要不要相信一套方法,靠的是它过去的表现。这个判断逻辑本身没错——问题是这个逻辑有个前提:你看到的表现,必须是这套方法的全部表现。 一旦展示者对样本做过取舍,你那个正常的、健康的推理过程,就会被喂进一份特制的输入,然后输出一个特制的结论。你不是不会思考,你是被换掉了思考的原料。
所以看这类材料,你要养成的第一个习惯不是「找破绽」,而是问一句:这份材料的分母在哪儿? 说对了五次,是五次里对五次,还是五十次里对五次?这句话问出来,一半的手法当场就没法继续了。
下面逐条拆。
手法一:只让你看见活着的那些
最普遍的一种,就是上面那个邮件把戏的原样搬运。展示的时候只放涨了的截图,没涨的那些对话不删也不提,它们只是不出现在这张图里。
它在数学上错在哪: 一个比率的分子和分母必须来自同一份名单。只公布分子(说对的次数),分母就成了你自己脑补的东西,而人在脑补分母的时候会严重低估。看到五张说对的截图,人的默认假设是「他大概总共也就说了六七次」,但真实的分母可能是六七十次。同样五张截图,前者是七成准确率,后者不到一成——图完全一样,结论差了一个数量级。
这跟量化里那个最老的坑是同一件事,站内概念卡把它讲得更细:幸存者偏差——历史数据里只剩下活到今天的公司,退市的、被合并的根本没进统计,于是算出来的收益天然偏高。展示战绩时只留说对的记录,是同一个动作的手动版本。
还有一个更隐蔽的变体:账户级的幸存。同时开十个账户跑不同参数,半年后把亏掉的九个关掉,只展示活下来的那一个。这一个账户的记录是完全真实的、每一笔成交都查得到,但它代表的不是「这套方法有效」,而是「十个里总有一个运气好」。
你能问的一句话: 同一时间段内,你一共发出过多少条判断?请给出全部记录,不是精选。
手法二:起止点是看完数据之后才定的
第二种手法一个字都不用改,只需要挪动两个日期。
任何一条真实的净值曲线(就是账户总资产随时间变化的那条线),只要它有起有伏,里面就一定存在某个子区间是明显向上的。这不是运气,是数学上的必然:一串有正有负的数,其中必定存在一个和最大的连续片段。你把起点定在那个片段的开头,终点定在结尾,截出来的那一段一定好看。
它在数学上错在哪: 问题不在于那一段是假的——那一段是真的。问题在于这两个日期是看完全部数据之后才选定的。一个结论的说服力,来自它在你「还不知道答案时」就已经定下;一旦选择发生在知道答案之后,这个结论就不再包含任何关于未来的信息,它只是对已知数据的一次重述。
在量化里这个毛病有个专门的名字,站内概念卡叫它数据窥探:你在同一份历史数据上反复试,试到一个好看的结果为止,这个结果的好看程度里,绝大部分是「试的次数」贡献的,不是方法贡献的。挑区间是它最粗暴的一种形式。
具体形态有几种,认一下就行:区间掐得特别整齐但起点是个奇怪的日子;只展示某一段而对相邻的前后段避而不谈;口径在中途换过(比如前半段算的是某个组合,后半段换成了另一个)。
你能问的一句话: 把起点往前挪三个月、往后挪三个月,这条曲线分别长什么样?
手法三:那条曲线是重放出来的,不是成交出来的
这一条最需要拆清楚,因为它最容易被善意地混淆——很多时候展示者自己都没意识到两者的区别。
回测是指:拿一段历史数据,让程序按照事先写好的规则,把这段历史「演」一遍,然后统计假如当时这么做会得到什么结果。它的产物是一条曲线,看起来跟真实账户的曲线一模一样,但它背后没有一笔真实成交。站内概念卡回测到底在算什么专门拆过程序内部那层循环。
它在数学上错在哪: 回测不是记录,是一堆假设的计算结果。这些假设不是玄学,是明明白白写在文档里的。举个具体的:开源交易框架 freqtrade 在自己的回测文档里专门列了一节「回测所做的假设」,其中几条是——买入按开盘价成交;只要价格落在当根 K 线的最高最低之间,所有订单都按你要的价格全额成交,不计滑点(滑点就是你想按这个价买,实际成交价却差了一点);止损严格按止损价成交,哪怕当时最低价比它更低。
这些假设是为了让计算能进行下去,框架作者写得非常坦率。但你要看懂它们的含义:回测世界里,你永远买得到、永远卖得掉、永远按你想要的价格。 真实市场里这三条没有一条是无条件成立的。
更关键的是第二层:回测用的那套规则和参数,通常就是在这段历史上调出来的。用同一段数据既调参数又验成绩,这叫样本内成绩,它天然好看,好看到几乎没有参考价值。这个落差有多大,站内教程回测好看实盘亏,差的到底是哪三件事拆得更细。
顺带把三种材料的分量排一下,这个排序你记住比什么都管用:
- 回测曲线——一个假设集合的计算输出,证据分量最低;
- 模拟盘记录——用真实行情逐日推进,不受未来数据污染,但仍然没有真实成交,分量中等;
- 真实成交流水——带成交时间、成交价、手续费的逐笔记录,分量最高。
这三样东西画出来的图长得几乎一样,而它们能支撑的结论完全不在一个级别。展示时把回测曲线放出来、把「回测」两个字放在角落里用小字标注,甚至干脆不标——这就是这个手法的全部内容。
你能问的一句话: 这条曲线是回测、模拟盘,还是真实成交?如果是真实成交,逐笔记录里有手续费那一栏吗?
手法四:把一个概率,说成一件事
这一条不动数据,只动措辞。
同一件事有两种说法:「按历史统计,这类情形之后上涨的比例约六成」和「这个位置要涨」。前一句是个带分布的陈述,后一句是个确定性断言。从前一句到后一句,中间被悄悄扔掉的东西叫不确定性——而在投资里,被扔掉的恰恰是最该保留的那部分。
它在数学上错在哪: 六成的胜率,意味着十次里有四次是错的,而且你没法知道下一次是哪一种。一个正确的概率陈述,无论单次结果如何都不算说错;一个确定性断言,只要错一次就该被推翻。把前者说成后者,等于既拿走了「说对时」的全部功劳,又豁免了「说错时」的全部责任。
这里还有一层更容易被忽略的:次数少的时候,概率根本显不出来。 六成胜率的方法,连错三次的概率并不低;同样,一个纯靠抛硬币的方法,连对三次也一点都不稀奇。所以短期战绩——十次八次这个量级——几乎不含信息。这背后是大数定律的适用边界,站内大数定律与赌徒谬误那篇讲的就是「多少次才算多」这个问题。
还有一种措辞上的变体,值得单独认一下:两头都占的表述。「短期有望上攻,若不及预期则注意回踩确认」——涨了算说对,跌了也算提醒过。这类句子的特点是没有任何一种未来能证明它错,而一个无法被证伪的判断,事后无论怎么复盘都会显示为「准」。识别它的方法很简单:读完之后问自己,明天发生什么才算这句话说错了?答不上来,这句话就没有内容。
顺便说一句,AI 生成的股评特别容易呈现这种形态,倒不一定是有意为之——它学的就是这种文体。这件事在AI 能不能预测股价,先看清它到底在算什么里拆过:说得像和算得准,中间隔着整整一个学科。
你能问的一句话: 明天出现什么情况,算你这句话说错了?
手法五:免费那一段,是用来做筛选的
最后一种,是把手法一商业化。
流程大致是:先大范围免费推送,内容越多越好、覆盖面越广越好;一段时间后,总有一部分接收者恰好看到的是说对的那几条;对这部分人做转化。
它在数学上错在哪: 免费阶段的成本极低,而只需要极小比例的人被转化,整件事就成立。这里没有任何一步需要说谎——推送是真的,说对的那几条也是真的,看到它们的人的体验完全真实。起作用的仍然是那句老话:筛的是人,不是方法。
有两个附带的形态一起认了:
一是事后追认。同一时段发出很多条不同方向的判断,回头只把说对的那几条集中做成复盘。这跟手法一是一回事,只是发生在推送场景里。
二是换算口径。展示的时候用「累计收益」而不是「同期与基准的差额」。市场整体涨的时候,几乎任何方法都能做出正的累计收益,这个数字里有多少是方法带来的、多少是行情带来的,不减掉同期基准根本看不出来。这是个正经的量化口径问题,不是话术问题——但展示时只报前者不报后者,效果等同于话术。
你能问的一句话: 同一时段的推送全集在哪儿?以及,这个收益减掉同期市场平均之后,还剩多少?
把五个问题攒成一张嘴边的清单
上面五句话,其实可以合并成一个动作:每看到一个漂亮的数字,就去找它的分母、它的时间边界、它的材料来源。
摊开写就是这五句,建议直接背下来:
- 全部记录在哪儿?不是精选,是全集。
- 起止日期是怎么定的?前后各挪三个月长什么样?
- 这是回测、模拟盘,还是真实成交流水?
- 明天发生什么,算这句话说错了?
- 减掉同期市场平均之后,还剩多少?
这五个问题有个共同的好处:它们都不需要你懂技术。 你不用会看代码,不用懂模型,不用判断对方水平高低。你只是在要求对方把材料补完整——而这五样东西,凡是站得住的展示都拿得出来,凡是拿不出来的,你也不必再往下看了。
反过来也一样值得提醒:这五条同样适用于你自己。你自己跑出来的那条好看的曲线,也得挨这五刀。人对自己的成绩天然会做这五种处理,而且完全无意识——只记得说对的那几次、下意识把起点挪到低位、拿回测当成绩、把「大概率」在心里读成「肯定」。对别人的材料严格,对自己的材料也严格,这一节才算真的读完了。
一句话说完
好看的成绩单,多半不是把数字改漂亮了,而是把难看的那部分挪出了你的视线;所以别急着评价你看见的东西,先问一句「我没看见的那些呢」。
本文为投资教育整理,关键数据与结论请结合下列权威来源验证。