← 返回教程库

同一个问题问两遍,答案为什么不一样

最后更新 2026-08-19
📚 量化与 AI 投研 📖 AI 投资祛魅 ⏱ 约 16 分钟 R2 · 注意风险
你将学到
  • 说清同一个问题两次答案不同的机制,以及为什么把「温度」旋到最保守也做不到完全一致
  • 会用原样重复、改写重复、翻转重复三种问法,把重复提问变成一次免费的可靠性检测
  • 拿到多份答案后,按数字层、结论层、措辞层三档判读稳定度,并知道每一档对应什么动作

昨天晚上你问 AI:某消费公司这两年毛利率的变化趋势是什么样的,为什么。它给了你一段挺顺的分析,你觉得有道理,顺手记进了自己的研究笔记。

今天你想再确认一下细节,把同一句话又问了一遍。这回它给的说法变了——重点不一样了,有一个数字对不上,甚至连「主要原因」都换了一个。

你的第一反应大概是:哪一次是对的?

这个反应很自然,但它把整件事引向了一条死路。因为在多数情况下,正确答案是「两次都不能直接用」。而更有价值的问题是另一个:它凭什么会变? 你能把这个问题想透,就等于白捡了一个可靠性检测工具——不用花钱,不用装东西,只要多按一次回车。

这一节讲的就是这件事。

生活层:它不是在「查」答案,是在「抽」答案

先把投资放一放,看一个日常场景。

你身边有两种人。一种是真的去过那个地方的人,你问他三次「那家店在哪」,他三次给的路线是一样的,可能措辞不同——「过了红绿灯右拐」「路口右边」——但拐的方向、走的米数不会变。另一种是特别会讲故事的人,他没去过,但他听人说过、也见过很多类似的街景,你问他三次,他三次都能给你一段听起来很像样的描述,问题是三次的细节对不上:第一次说在二楼,第二次说在街角,第三次多了个招牌颜色。

他不是在骗你。他是在「生成」一个最像样的答案,而不是在「回忆」一个存在的答案。

这类语言模型,工作方式更接近第二种人,而且是被明确设计成这样的。它每写一个字,实际做的事情是:先算出「下一个字可能是什么」的一张概率表——「毛利」后面接「率」的可能性很高,接「空间」也有一些可能,接「上升」「下滑」各有一点——然后从这张表里一个出来,而不是每次都死板地挑那个可能性最高的。抽到什么,就往下接着写,接下来的整段话都会被这一次抽签带着走。

一开始那点小小的差别,写到三百字之后就可能变成完全不同的两段结论。这就像走岔路口:第一个路口偏了半米,走到终点差出一条街。

所以答案会变,不是故障,是这台机器的正常工作方式。指望它像计算器那样每次给出一模一样的东西,是对它的误解。

投资层:变与不变的那条线,正好是你最想知道的线

现在把这件事挪回你的研究桌上。

同一份材料喂进去,同一个问题问三遍。你会发现输出里有些东西几乎不动,有些东西每次都在漂。这条分界线,对你极其有用:

几乎不动的部分,通常是有东西撑着的。 材料里白纸黑字写了的、行业里翻来覆去说过一万遍的常识,它每次都会稳定地复现出来——因为这些内容在那张概率表里占的比重压倒性地高,怎么抽都会抽到它。

每次都在漂的部分,通常是当场生成的。 一个具体的百分比、一句「主要原因是……」的因果判断、一个精确的排名,如果三次三个样,那说明在那个位置上,模型手里根本没有一个压倒性的答案,它只是每次都从几个都还说得过去的候选里抽了一个交差。

把这话说得再狠一点,也是本节最该记住的一句:

一个结论如果换个问法就变了,那它不是从材料里推出来的,是生成出来的。

为什么这件事在投资里特别要命?因为投资的错误反馈来得很慢,慢到你根本等不到它纠正你。一个编出来的毛利率数字,你可能三个月后才在别处撞见真数字,而这三个月里你已经拿它当过决策依据了。这类数字长什么样、为什么你当场发现不了,在 编造的财务数字长什么样,以及你为什么发现不了 里有更细的拆解。

还有一层更隐蔽的危险:你会替它挑答案。

三份答案摆在面前,其中一份正好符合你已经形成的看法,另外两份跟你的想法拧着。你会留下哪一份?绝大多数人会留下第一份,而且会真心觉得那份「写得更好」。这就是确认偏误——人会不自觉地偏爱那些支持自己既有观点的信息,并且给它找出一堆理由。

于是「多问几遍」这个动作,本身就有两副面孔:它可以是一次严格的检测,也可以是一次高效的自欺——你不停地问,直到问出你想听的那句话为止。 区别只在一件事上:你有没有在看到答案之前就把判读规则定好。

这也是下面这套做法必须按顺序执行的原因。

机制层之一:为什么把旋钮拧死也做不到完全一样

有人听到这里会说:我知道有个参数能控制随机性,把它调到最保守那一档不就行了吗?

这个想法方向是对的,但它解决不了你的问题,原因有三层。

第一层,正经项目确实会这么做,而且默认就这么做。 开源 AI 投研项目 Vibe-Trading 里,控制采样随机性的那个参数(业内叫「温度」,值越低输出越保守、越倾向于每次都挑最有把握的那个词),默认值就设成了最保守的那一档,配置里还专门校验它的取值范围,超出范围直接拒绝。这个选择本身就是一条信息:一个要拿输出去做严肃分析的系统,第一件事就是把随机性往下压。

第二层,这个旋钮不一定拧得动。 还是这个项目,它的模型调用层里写了一段专门的兼容逻辑:有的模型接口根本不接受这个参数,你传过去它直接报错;于是代码的做法是——接到这类报错就把这个参数从请求里摘掉,再重试一次。也就是说,「调低温度」这条路在一部分模型上压根不存在。你在网页聊天框里就更别提了,那里通常连这个旋钮都没暴露给你。

第三层,就算拧死了,也只是「更像」而不是「一样」。 输出还受另外几件事影响,而这几件事你都控制不了:服务方随时可能更新背后的模型;带联网检索的问答,每次取回的网页可能就不同;对话里塞进去的系统设定、当前日期这些东西也在变。所以你今天问和下个月问,答案不同,未必是随机性,可能是它背后的东西已经换了。

结论很实在:别把精力花在「让它别变」上,把精力花在「用它的变来做检测」上。 变化是免费送到你手上的信息,扔掉太可惜。

机制层之二:三种重复,各检测一件事

重复提问不是傻问三遍。三种问法测的是三件不同的事,建议按顺序做。

第一种,原样重复。 一字不改,问三遍。关键动作是:每一遍都必须新开一个对话。在同一个对话里连问三次,它会看到自己前面写过什么,然后本能地保持一致——这时候你测到的不是它的稳定性,是它的自我一致性,那玩意儿一文不值。测的是:这个答案里哪些成分是随机抽出来的。

第二种,改写重复。 意思一模一样,措辞换掉。比如「这家公司的毛利率为什么下滑」换成「哪些因素影响了这家公司近两年的毛利率水平」。注意后一种问法里没有「下滑」这个预设。测的是:你的问法里带了多少诱导。如果去掉预设之后结论跟着变了,那原来的结论有一半是你自己喂进去的。

第三种,翻转重复。 把立场反过来问:先问「支持买入的理由」,另开一个对话问「反对买入的理由」,最好再来一个「为什么现在什么都不做才对」。测的是:它到底有没有立场。如果三次都能给出同样自信、同样工整、同样长的论证,那这套论证的产出跟事实关系不大,跟你的提问方式关系很大。这一条几乎每次都能戳破点什么。

三种做完,你手上有五到七份答案。接下来才是重点:怎么读。

机制层之三:三档判读,每档对应一个动作

把几份答案并排放着,逐项对照,分三档处理。判读规则要在问之前就定好,不能看完再定。

数字层——只要不一致,一律作废。 具体金额、百分比、增速、排名、日期、条款编号,只要几份答案对不上,这个数字就是不可用的,不存在「取多数」这回事。三次里有两次一样,也可能是同一个错误被抽中了两次。唯一的动作是:回原始文件查,年报、公告、交易所披露,查到为止;查不到就当这个数字不存在,别写进你的笔记。更要紧的是——几份答案完全一致的数字,也只是「值得一查」,不是「可以直接用」。这一层的详细核对清单,本卷里 AI 说得有鼻子有眼,可那个数字是编的 那篇给得比这里全。

结论层——不一致的,降级成问题清单。 「主要原因是渠道结构变化」这种因果判断,如果三次给了三个不同的主要原因,正确的处理不是选一个,而是把这三个原因全部记下来当成待查项:渠道结构、原材料成本、产品结构,一个一个回财报里找证据。你会发现这时候 AI 的价值反而变大了——它一次给你一个答案是在帮倒忙,一次给你三个方向是在帮你列提纲。它产出问题清单是可靠的,产出结论是不可靠的。

措辞层——不一致是正常的,别管它。 段落顺序、详略、用词、小标题怎么起,这些每次都不同完全正常,不构成任何信号。别在这一层浪费注意力,很多人做完对比之后感慨「变化好大」,其实变的全是这一层。

这套动作该卡在你整个流程的哪个位置——是当场做、还是等汇总时做——核对这件事,放到最后做就已经晚了 那篇讲得更细。原则上,越靠前越省事:一个错数字在取数那一步作废只花一分钟,等它进了结论再作废,你要推翻的是半天的活。

🚧 避坑

坑:把「重复提问」用成「多问几次总有一次说到我心坎上」。 这是最常见的变形,而且当事人往往意识不到。怎么避:定一条硬规矩——判读规则先写下来,答案后看;并且明确规定「三份答案里挑一份用」是被禁止的动作,你只能做两件事,要么把一致的部分留下,要么把不一致的部分变成待查清单。

机制层之四:一致,不等于对

这一层必须补上,否则前面全套动作会被用歪。

稳定只是必要条件,不是充分条件。 一个说法之所以每次都稳定出现,最常见的原因是它在训练材料里被重复了无数遍——而「被重复无数遍」和「是对的」是两回事。行业里流传很广的错误、早已改口的旧说法、被反复转载的一份错数据,都会稳定地复现出来,而且比真话复现得还稳。

所以正确的用法是这样的:不一致,可以直接判它不可用;一致,只能说明它值得你花时间去核。 前者是快速排除,后者不是放行。这一点跟本卷讲的另一件事完全同构——AI 说得越顺、越符合你已有的印象,越说明这是市场共识,而共识里通常不藏超额收益。这条线索的完整推理在 AI 能不能预测股价,先看清它到底在算什么 里。

顺便说:量化那边早就这么干了

有意思的是,「重复很多次,看结果稳不稳」这个思路,在量化工程里是标准动作,只是没人把它挪到 AI 问答上。

一个例子:Vibe-Trading 的回测校验模块里,判断一条策略的收益是不是运气,用的办法是把同一件事重复抽样跑很多次,看结果的分布,而不是跑一次看一个数——这就是蒙特卡洛的思路,说白了就是「靠大量重复随机试验来估计一件事到底有多大可能」。同一段代码还把随机种子(决定这一串随机数怎么生成的那个起始值,固定住它就能重跑出一模一样的结果)默认写死,为的是让别人能复现。

另一个例子更传神:开源量化框架 freqtrade 在做参数搜索时,如果你没指定随机种子,它会自己随机取一个,然后把取到的值打进日志里。设计者的意思很明白——我承认这一轮结果依赖于随机,所以我把这个随机记下来,你要么复现它,要么换个种子再跑一遍看结论稳不稳。

请把这两件事和你的聊天窗口放在一起看。工程界对随机性的态度是:承认它、记录它、然后用重复去度量结论对它有多敏感。 而你在对话框里做的事,通常是问一遍、看一眼、信了。差的就是「重复」这一步,而这一步是免费的。想把这套思路进一步扩展成对一个模型是否适合做投研的完整测法,可以接着看 怎么自己测一个模型适不适合做投研;想理解重复随机试验为什么能说明问题,概念库里 蒙特卡洛检验 那篇是正主。

什么时候值得做,什么时候不必

最后说点实际的。全套做下来要问五六遍,读五六份,成本不低,所以别对什么都做。

必须做的:这个数字或这个结论要拿去支撑一个决定。要写进你的投资记录、要影响仓位、要说服你自己或别人的,一律做。

做简版的:只做「翻转重复」一条,问一次正面一次反面。这一条性价比最高,两分钟出结果,能筛掉大部分「怎么问都能给你一套说辞」的空话。

不必做的:让它翻译一个术语、把公告整理成表格、按你的框架定位原文段落——这些活儿的输出你一眼就能看出对不对,不需要靠重复来检测。

⚠️ 风险提示

本节所有内容只讲方法与原理,不构成任何投资建议,也不针对任何具体标的。特别提醒:市面上有把「AI 每次都给出一致结论」当作可靠性卖点的话术,按本节的判据看,一致本身什么都证明不了——它既可能来自材料扎实,也可能来自把随机性关掉后稳定地重复同一个错误。完整边界见 免责声明

小结

  • 答案会变不是故障:这类模型每写一个字都是从一张概率表里一个,起点差半米,三百字后差一条街。
  • 变与不变那条线,正好是你最想要的线:几乎不动的部分通常有材料撑着,每次都漂的部分通常是当场生成的。
  • 把「温度」拧到最保守只能更像、不能一样:这个旋钮在部分模型上根本不存在,而且服务端的模型、检索结果、上下文都在变。别求它不变,要用它的变做检测。
  • 三种重复各测一件事:原样重复(每遍必须新开对话)测随机成分、改写重复测你的问法带了多少诱导、翻转重复测它有没有立场。
  • 三档判读,规则必须问之前就定好:数字层不一致一律作废回原始文件;结论层不一致降级成待查清单;措辞层不一致属正常,别理。
  • 一致不等于对:不一致可以直接判不可用,一致只说明值得你去核,不是放行。
  • 最大的陷阱不是它答错,是你不停地问直到问出你想听的那句——所以「三份里挑一份用」必须被明令禁止。

一句话总结:它每次说的话都不太一样,那些每次都一样的,多半是真有出处;那些每次都变的,基本是当场编的——你只要多按一次回车,就能把这两拨分开。

内容有错、看不懂、或想看下一篇?告诉我们 →

本文为投资教育整理,不构成任何投资建议;不荐个股/基金、不预测点位、不承诺收益。关键数据与结论请结合权威来源自行验证,并见风险免责声明