← 返回教程库

那个数字是编的,可它比真的还像真的

最后更新 2026-08-19
📚 量化与 AI 投研 📖 AI 投资祛魅 ⏱ 约 16 分钟 R2 · 注意风险
你将学到
  • 说清编造的数字为什么天然落在「合理」区间,能靠「这组数丑不丑」反过来判断它可能没被查过
  • 认出让你放过假数字的五个认知习惯,尤其是「核查被违和感触发」和「只有反对你的数字才会被检验」这两条
  • 会做三个对冲动作:先写预期区间再看数、优先核查支持你结论的数字、把数字和出处在笔记里绑死

先说一个你可能亲身经历过的情况。

你早就知道这类工具会编数字,所以你留了个心眼。它给你整理了一张某消费公司近五年的经营数据表,十来个格子。你挑了两个看着别扭的数去查——一个查完是对的,一个稍微差了点,你改过来了。剩下那些你没查,因为它们看起来没什么可疑的地方。

两周后你在别处看到真实数据,发现你没查的那几个里,有两个压根不存在。

问题来了:你不是不知道它会编,你也不是没查,你只是查了「看起来可疑的」那些。而它编出来的东西,恰好一点都不可疑。

这篇要拆的就是这件事。至于它会编成哪几种样子、一个数字该怎么逐条核,AI 幻觉的四种形态与核验清单 讲得很细;错误容易在流程的哪一段冒出来、每道工序该架什么闸门,AI 投研这条流水线上翻车的地方 讲过了。这两篇都不重复。本篇只问一个问题:为什么假的看起来比真的还可信,以及你脑子里的哪些习惯让你必然放过它。

先用画像这件事说明白

你请一个画师,凭你的口述画你小时候住过的那栋老房子。你说:两层,红砖,门口有棵树,窗户是那种老式的木框。

画师画出来了。你一看,心里咯噔一下——太像了。

但你仔细想想就明白了:他画的不是你家那栋房子,他画的是「一栋符合你描述的老房子」。他这辈子画过、见过成千上万栋老房子,红砖的纹理该怎么走、木窗框该有多厚、树该怎么歪,他都知道。他画出来的,本质上是所有这类房子的平均值

而平均值有个奇怪的性质:它比任何一栋真房子都更像「一栋老房子」。

你家那栋真房子是什么样呢?它有一块砖是后来补的、颜色不对;二楼有个窗户当年被砸了,换成了铝合金的,和其它窗不一样;门口那棵树因为压着电线被砍了半边,长得很难看。真实的东西总是带着这些不讲道理的疙瘩,因为它经历过具体的事。

画师画不出这些疙瘩,因为他不知道你家发生过什么。所以他的画干净、协调、每个细节都恰到好处——而这份恰到好处,正是它是假的证据。

你没认出来,是因为你脑子里对「老房子该长什么样」的印象,跟画师用来作画的那套印象,是同一套。你的鉴别器和他的生成器,用的是同一本参考书。

放到投资决策里,这意味着什么

把画师换成 AI,把老房子换成一家公司的财务数字,整件事的性质完全一样,但后果严重得多。

严重在哪?在于你的核查动作是被感觉触发的

回想你平时怎么核对。你不是拿到一份材料就把每个数都去查一遍——那太累了,也没人真这么干。你的实际做法是:读下来,某个地方让你「咯噔」一下,你才停下来去查。这个咯噔,可能是数字大得离谱、可能是前后对不上、可能是和你的印象冲突。

这个机制在应付人的错误时相当好用。人写错数通常是手滑:多打一个零、抄错一行、单位搞混。这些错误往往很扎眼,一眼就能挑出来。

但 AI 编的数字不是手滑。它是照着「一个合理的数应该长什么样」生成出来的。换句话说,它的生成目标,恰好就是不触发你的咯噔。

于是你的核查网出现了一个结构性的漏洞:你能查出来的错,它基本不犯;它犯的错,正好落在你的网眼里。 你越是熟悉这个行业、对数字的量级越有感觉,这个漏洞反而越大——因为你的「合理感」越强,你能自动放行的东西就越多。

这就是为什么「我会核对」这句话在这件事上没有想象中管用。你会核对的是你觉得该核对的那部分,而那部分恰好不是问题所在。

它为什么长得这么像真的:四个来源

具体拆开看,一个编出来的数字身上有四层「可信包装」,每一层都是它天然自带的,不需要它刻意伪装。

一、量级永远是对的

这是最基础的一层。这类模型读过海量的财报、研报、新闻,所以「一家做家电的公司毛利率大概在什么范围」「一家几十亿营收的消费公司应付账款大概是多少量级」,它是有底的。它编出来的数不会离谱到让你笑出声。

量级恰恰是你唯一能靠直觉检验的东西。你看一个数,脑子里过一遍「这个数合理吗」,你实际在检验的就是量级。量级过关,你的检验就结束了。

所以这一层不是「它碰巧蒙对了」,而是它生成的方式决定了它必然落在你的合理区间里。你和它对「合理」的定义来自同一批公开材料。

二、多个数字之间是自洽的,因为它们是一起生成的

这一层更隐蔽,也更值得琢磨。

假设它要给你五年的营收。如果它是真去查,它会一年一年地查,五个数各自独立地来自五份不同的文件。独立来源的数字凑在一起,多半是有点不规则的——某一年增速突然掉下来(那年可能有一次剥离),某一年突然跳上去(可能并进来一块业务),某个季度特别难看(可能碰上一次一次性计提)。

但如果它是生成的,这五个数是在同一次生成里一起出来的。它会自动让它们连成一条讲得通的线:稳步增长、增速温和放缓、符合一个「成熟消费公司」该有的样子。

结果是:假数据的内部一致性,往往比真数据更高。

而你验证数据的一个常用手段,恰恰是看内部自不自洽——增速和绝对值对不对得上、市值和股价股本对不对得上。这个手段对付抄错行很有效,对付整批生成的数据几乎完全失效,因为它们本来就是按自洽的标准造出来的。

这里可以顺一句:真实世界里的财务数字为什么总是带疙瘩?因为公司会做具体的事——收购、剥离、换审计口径、遭遇一次诉讼赔偿、某年退税。每一个疙瘩背后都有一件具体的事。 一组光溜溜、没有任何疙瘩的历史数据,要么这家公司过去五年什么都没发生(极罕见),要么这组数没经过任何具体事件的洗礼。

三、格式规范带来的可信度转移

第三层几乎是纯粹的心理效应。

「营收 48.7 亿元,同比增长 12.3%」——注意这句话里有多少可信度信号:单位写了、小数点后一位、同比标注了、增长率和绝对值配套出现。这套格式你在正经的研报里见过一万次。

于是发生了一件很微妙的事:你把「这段话的格式属于可信来源」,读成了「这段话的内容可信」。

这跟看到一个穿白大褂的人就默认他懂医是同一回事。白大褂是真的,穿白大褂的人未必。而这类模型最擅长的恰恰是复现文体——它没见过这家公司的年报,但它见过一万份年报长什么样。

有一个细节能帮你体会这一层有多难破。开源的 AI 投研项目里,有人专门写代码去校验「答案里的价格数字有没有证据支撑」,结果发现光是界定什么算一个数字主张就极其麻烦:日期里的数字不能算、「一百股」这种带单位的数量不能算、汇总金额不能拿去和单价比、写成算式的推导要当整体读。做这套东西的人最后在注释里坦白:一个每股价格如果只写成一个光秃秃的小数、没有任何单位或推导标记,机器就抓不到它。

连专门写来干这件事的程序,都没法只靠「这个数长什么样」判断它真假。 你靠肉眼扫一遍就更不可能。这也是为什么那套机制最后要求答案必须同时给出规范代码、数据来源、计价货币——判断真假靠的是它背后挂了什么,不是它自己长什么样。

四、它跟你的预期一致,因为你的预期是它的输入

第四层最狠,也最少被人意识到。

你问它的方式,已经把你的预期泄露给它了。

「这家公司这两年增长是不是在放缓?」——你已经告诉它答案的方向了。它接下来生成的,是一段支持「放缓」这个语境的续写,包括那几个数字。你问「这家公司的现金流是不是比同行健康?」,你会拿到一组显得健康的数。

然后你看着这些数,感觉「果然如此,我的判断被证实了」。

实际上没有任何东西被证实。你只是把自己的假设发出去,又收回来了一遍。 这个回路里没有引入任何新信息,但它给你的确信感,和真的查到了证据一模一样——甚至更强,因为它比真证据更整齐、更全面、更直接对准你的问题。

这一条有个直接的副作用:你越是带着结论去问,拿到的材料就越像证据。 而带着结论去问,恰恰是绝大多数人使用这类工具的默认方式。

你的哪些习惯让你发现不了

上面四条讲的是它那边。下面五条讲你这边——这些都不是缺点,它们在日常生活里全都是省事的好习惯,只是在这件事上刚好全部失效。

第一,读得顺就觉得是真的。 人判断一句话可不可信,很大程度上是靠读它时费不费劲。费劲的、别扭的、要回头再读一遍的,你会本能地打个问号;顺滑的、一读就懂的,你直接吸收。这个机制平时挺高效,问题是这类工具的核心能力就是把话说顺。你等于把「可信」这个开关,交给了它最强的那项能力去控制。

第二,核查是被违和感触发的,不是被制度触发的。 前面说过了,这里补一句更要命的:你以为你在按需核查,其实你在按情绪核查。 你今天精神好、有闲,你多查两个;你晚上十一点看完一份材料,你一个都不想查。核查的密度取决于你当时的状态,而不取决于内容的风险。这就是为什么这件事只能靠固定动作解决,不能靠「我以后小心点」。

第三,只有反对你的数字才会被检验。 这一条你可以马上验证:回想你上次看到一个和你判断相左的数据,你是不是立刻想「这数据哪来的、是不是口径不对」?再回想一个支持你判断的数据,你是不是顺手就用了?

人对信息的审查强度是不对称的:不合意的要过三堂会审,合意的直接放行。 把这条和上一节的第四点叠在一起,你会看到一个非常糟糕的组合——它生成的数字天然偏向支持你的预期,而你对支持你的数字天然不设防。这两件事撞在一起,等于门口没有岗哨。

第四,你会记住数字,忘掉它从哪来。 这个现象很普遍:一周之后,你脑子里剩下「那家公司毛利率三十几」,但「这个数是我从年报查的还是它给我的」已经没了。数字比来源活得久。 于是一个未经核实的数字,会在几周后被未来的你当成一条已知事实拿去做推理,而且理直气壮——因为你确实「记得」它。

第五,就算你后来发现它是编的,它已经改变了你。 这一条是最难对付的。假设它告诉你某个数是 40%,你后来查清楚实际是 28%。你以为改过来就没事了?不一定。你在看到 40% 的那一刻,心里对这家公司的定位已经挪过一次位置了。之后哪怕你用的是 28%,你对「这算高还是低」「这门生意好不好」的感觉,仍然带着那个 40% 留下的印子。

这一条推出一个重要的结论:事后核对不足以完全消除伤害。 有些防线必须建在你看到那个数字之前,而不是之后。

还有一个更麻烦的循环

假设你决定认真核了。你把那个数字复制下来去搜。

搜到了,一篇文章里明明白白写着同一个数。你放心了。

但那篇文章可能本身就是机器批量生成的内容——网上这类东西的数量在肉眼可见地变多。你以为你做了交叉验证,实际上你验证到的是一份同源产物。 更糟的是,这次「对上了」的经历会大幅提高你对这个工具的信任,让你下次查得更少。

所以核对这件事有个硬性要求,跟你用不用 AI 无关:必须核到原始文件本身——公司自己发布的公告、报表、交易所的行情,而不是任何一层转述。这条纪律的完整展开在 一手资料纪律 那篇。同理,「换个模型再问一遍看看一不一致」也不能算验证,同一个问题问两遍答案为什么不一样 讲的是不一致本身能告诉你什么——但一致也证明不了对,两个读过高度重合材料的模型,会以同样的自信犯同一个错。

三个能真正对冲的动作

前面全是坏消息,这里给三个动作。它们的共同点是:都不依赖你当时警不警觉。

动作一:先写下你的预期区间,再看它给的数。

在你问它某家公司的毛利率之前,先自己写一行:我猜大概在多少到多少之间,理由是什么。写完再看。

这个动作的价值不在于你猜得准,而在于它给了你一个不受污染的参照点。一旦你先看了它给的数,你就永远不知道自己原本会怎么想了——上面第五条讲的那个印子,就是这么留下的。先写下来,等于给自己留了一份「被影响之前的底稿」。

如果它给的数落在你的区间外,很好,你有了明确的核查理由;如果落在区间内,你也知道这只说明它和你的先验一致,不说明它查过

动作二:优先核查那些支持你结论的数字。

这条是反直觉的,但它直接对冲第三个习惯。既然你对不合意的数字本来就会自动严查,那你有限的核查预算就不该花在那儿。把核查资源倾斜到「我看着很顺眼的那几个数」上。

具体到操作:一份材料里挑三个数回原始文件核,挑的标准不是「哪个可疑」,而是「哪三个数在支撑我最后那个结论」。如果这三个都对得上,你对整份材料的信心才有理由提升;如果有一个对不上,那个结论就得推倒,不是打个补丁。

动作三:笔记里数字和出处绑死,绑不上的不进笔记。

对付第四个习惯只有这一个办法:任何一个数字进入你的记录时,必须同时带着它的出处——哪份文件、哪一期、哪一页。写不出出处的,宁可不记。

这条听着枯燥,但它是唯一能防住「未来的你」的东西。你现在知道这个数是 AI 给的、还没核;三周后的你不知道。你唯一能留给三周后那个人的东西,就是白纸黑字的出处。 出处栏空着,那个数字就该从笔记里删掉,而不是标个问号留着——问号也会被忘掉。

🚧 避坑

坑:把「我认真读了一遍」当成「我核对过了」。 读是理解内容,核是回原件对数,这是两件不同的事,消耗的也是完全不同的注意力。一份材料你可以读得非常投入、每句话都想过,同时一个数都没核。判断自己到底做了哪件事,有个很简单的标准:你这一轮有没有真的打开过原始文件? 没打开过,那就是读,不是核。

⚠️ 风险提示

上面讲的所有识别方法,都是提高发现问题的概率,不是保证。「三个动作全做了」不等于材料没问题,只等于你把最常见的几个漏洞堵上了。任何 AI 生成的材料都只是待验证的草稿,不构成投资建议,本站内容的完整边界见 免责声明

反过来说,也别走到另一个极端

把上面这些看完,有人会得出「那这东西根本不能用」的结论。这个结论同样是错的,而且代价不小。

分清楚它错在哪一类活儿上:它编的是「它不掌握的事实」,不是「它面前摆着的材料」。 你把一份原始公告的原文丢给它,让它从这份原文里把某几段找出来、整理成表格,出错的概率和让它凭空报一个数完全不是一个量级——因为答案就在它眼前,它不需要生成任何不存在的东西。

所以真正的分界线不在「用不用它」,而在你有没有把它需要的材料给足。让它加工你提供的材料,风险可控;让它从记忆里掏事实,风险不可控。这条线记住了,前面那些心理陷阱大部分就绕开了,因为你从一开始就没给它编造的机会。

小结

  • 编造的数字不是随机的错,它是照着「一个合理的数该长什么样」生成的,所以必然落在你的合理区间里。你的鉴别器和它的生成器,用的是同一套先验。
  • 它「像真的」有四个来源:量级对(你唯一能靠直觉查的东西正好被它满足)、多个数字自洽(因为是一起生成的,比真数据还整齐)、格式规范(把来源的可信度转移给了内容)、跟你预期一致(你的提问把预期泄露给了它)。
  • 真数据是丑的——有异常年份、有口径变更、有说不清的疙瘩,因为它经历过具体的事。一组光溜溜没有任何意外的历史数据,本身就值得警惕。
  • 让你放过它的五个习惯:读得顺就觉得真、核查靠违和感触发而不是靠制度、只有反对你的数字才被检验、记住数字忘掉来源、看过之后就算改回来印子也还在。
  • 最危险的组合是第三条和它的第四个来源撞在一起:它天然生成支持你预期的数,而你对支持你的数天然不设防。
  • 三个不依赖当场警觉的动作:先写预期区间再看数、把核查预算优先花在支持你结论的数字上、笔记里数字和出处绑死否则不记。
  • 核对必须核到原始文件。搜到另一篇文章说了同一个数,可能只是搜到了同源产物;换个模型再问一遍,也可能只是两个模型犯同一个错。

一句话总结:假的东西看着比真的还整齐,因为真的东西身上有磕碰,假的没挨过打。你觉得一份材料哪儿都挑不出毛病的时候,该起疑的正是这份完美。

本文对开源项目校验机制的引用来自站内概念库那篇的梳理,是代码层面的机制说明,不是运行结果。回 量化与 AI 投研概念库 看各概念的独立解释。

内容有错、看不懂、或想看下一篇?告诉我们 →

本文为投资教育整理,不构成任何投资建议;不荐个股/基金、不预测点位、不承诺收益。关键数据与结论请结合权威来源自行验证,并见风险免责声明