投资理财

AI 输出核验清单

拿到 AI 写的投研内容后,按清单逐条勾选,标出哪些数字必须回一手资料核对、哪些说法属于不可采信的推测。

  • 免费免注册
  • 结果可分享链接
  • 浏览器本地计算

AI 写出来的投研内容里,编造的部分和抄自年报的部分在文字上没有任何区别—— 都一样具体、一样自信。所以判断可信度不能靠通读,只能靠分类: 先分清哪些内容必须回一手资料,再在时间有限的前提下决定抽查多少条。 本工具全程在你的浏览器里运行,不上传任何内容,也不调用任何 AI 接口。

第一步(可选):数一数这份材料里有多少条要查

把 AI 的输出粘进来,工具会按关键词与数字模式做一次粗略扫描。 它不理解语义、也不判断对错,唯一的作用是把「这份材料要查的东西多不多」从感觉变成一个数字。 扫描结果宁多勿少,漏标比多标危险。

第二步:按类别决定怎么核

已确认 0/16

勾选表示「这一类我已经按要求处理过了」。勾选状态只留在本页面,不上传、不保存, 刷新即清空——真正要留档的是下面生成的那段核验记录。

必须逐个回查

0/6

打开一手资料(定期报告、公告、监管机构官网),把这个数字或这条事实找出来,逐字比对。

这几类内容有一个共同点:错了会直接改变结论,而且模型最容易在这里「补全」出一个看起来合理的值。

必须核对原文

0/2

找到被引述的那份原文本身,逐字比对引号内的内容,确认这句话确实存在、且没有被截断改意。

引号是一种极强的可信度背书,读者会默认它是原话。一旦引号里的内容是拼接出来的,整份材料的信誉全部作废。

必须标注时点

0/2

把「目前」「最新」「近期」这类词换成明确日期,并注明数据截止到哪一天。

这类词没有错误可言,但也没有信息量——它把「什么时候的事」这个关键条件藏了起来,读的人会默认是今天。

必须确认口径

0/3

确认基期、会计口径、币种与单位是否一致:同比比的是谁、合并还是母公司、扣非还是不扣非、有没有追溯调整。

口径不一致时,每个数字单看都是对的,放在一起做出来的对比却是错的——这种错最难被发现,因为回查单个数字查不出来。

可以放过

0/3

读懂即可,看逻辑自不自洽,不必回查。

通用概念与方法论是模型训练数据里高频、稳定的部分,出错概率低,且错了你自己一眼能看出来。把核验时间花在这里是浪费。

第三步:时间有限时,该抽检多少条

贵条目指直接支撑结论、你打算原样引用的那些数字,以及全部带引号的引述——这些必须全查。 剩下的才做抽样。单条耗时按你自己的实际速度填,不同资料的可及性差别很大,页面不预设任何数字。

22
建议核验条数
全查 12 + 抽查 10
36.7%
覆盖率
未核验 38 条
每 4 条抽 1 条
抽样间隔
起点随机,别固定从第一条开始
44 分钟
预计占用时间
  • 贵条目全查 12 条(20%)
  • 随机抽查 10 条(16.7%)
  • 未核验 38 条(63.3%)
方案:全查 12 条贵条目 + 抽查 10 条,合计 22 条,覆盖率 36.7%,约需 44 分钟。抽样的作用不是把每条都查对,而是估出这份材料的错误密度。

按什么规则抽

  1. 先把 12 条贵条目全部查完:直接支撑结论的数字、你打算原样引用的数字、以及任何带引号的引述,一条都不能跳。
  2. 剩下的 48 条做等距抽样:每 4 条抽 1 条,共抽 10 条。起点随机选,不要固定从第一条开始。
  3. 抽样点要跨段落均匀分布。集中抽开头几段是最常见的错误做法——它只能证明开头没问题。
  4. 一旦某段抽到错误,把该段的全部条目升级为全查,并把这一段的错误计入下面的判断。
  5. 每查一条就记下结论,别凭记忆汇总——核验记录本身就是这份材料的可信度凭证。

第四步:查完之后,这份材料还能不能用

把你实际查了多少条、其中发现几条错填进来。这里给出的不是「合格 / 不合格」的判决, 而是把抽检结果翻译成对未抽查部分的推断——你真正需要知道的是「没查的那些里还可能有多少条错」。

抽查 22 条全部核对无误,但这只说明错误率大致不高于 13.6%,不说明它没有错。

按这个上界推,没被抽到的 38 条里最多可能还藏着约 6 条错。样本越小,这个上界越宽松——抽 5 条全对几乎什么都证明不了。想把上界压下来,只有一个办法:多抽几条。

第五步:把核验过程留档

下面这段纯文本随你的勾选和输入实时更新,全选复制即可贴进笔记或邮件。 留档的意义不在于证明材料没错,而在于半年后你还知道:当时查了哪些、没查哪些、依据的是哪一版资料。

风险提示

  • 本工具不判断内容真假,它只提供分类规则与抽样算术。判断真假的唯一办法是回到一手资料逐条比对。
  • 抽检全部通过不等于材料无误,只说明错误率大致低于某个上界;样本越小,这个上界越宽松。
  • 粗略扫描基于关键词与数字模式,会漏也会多标,不能当作核验清单本身使用。
  • 本工具不调用任何 AI 接口、不联网、不上传你粘贴的任何内容,全部计算在你的浏览器里完成。
  • 本工具仅为流程演示与学习用途,不判断任何标的,不发出买卖信号,不构成投资建议,也不承诺任何收益。

教育演示:清单分类依据的是「错了会不会改变结论」与「模型在哪里最容易补全」, 抽检部分用的是等距抽样与错误密度外推。本工具仅为测算演示,不构成投资建议。

链接带当前参数,发给别人打开就是同一份结果。

怎么用

6 步
  1. 把材料粘进来数一数:先把 AI 写的那段内容整段粘进扫描框。工具按关键词与数字模式做一次粗略统计,告诉你里面有多少个数字、多少处引号、多少个「目前」。这一步不判断对错,只是把「要查的东西多不多」从模糊感觉变成一个具体数字。
  2. 按五档分类,而不是逐句通读:通读是最没用的核验方式,因为编造的句子和真实的句子读起来一模一样。改成按类别处理:财务数字、日期、人名职务、持股比例、监管处罚必须逐个回查;带引号的引述必须找到原文比对;「目前」「最新」必须换成明确日期;同比环比必须确认口径;通用概念与方法论可以放过。
  3. 标出贵条目:贵条目指直接支撑结论、你打算原样引用出去的那些数字,以及全部带引号的引述。它们必须全查,没有商量余地——一条贵条目错了,你基于它写的整段结论都要作废。把贵条目的条数单独填进计算器。
  4. 填时间,让工具替你做取舍:填上你能承受的核验总时间和平均每条耗时。工具先扣掉贵条目全查所需的时间,剩下的才拿去做抽样,并给出等距抽样的间隔。如果时间连贵条目都覆盖不了,它会直接告诉你——那时候该做的不是降低核验标准。
  5. 查完把结果填回去:填上你实际查了多少条、其中发现几条错。工具会把这个结果翻译成对未抽查部分的推断:全对时错误率大致不高于多少,抽到错时没查的部分里预计还藏着几条。这一步才是抽检真正的产出。
  6. 复制核验记录存档:最下面那段纯文本随你的勾选实时更新,全选复制贴进笔记即可。它记的不是「这份材料没错」,而是「当时查了哪些、没查哪些、依据的是哪一版资料」——半年后回头看,这个信息比结论本身更值钱。
深入讲解

通读是最没用的核验方式

拿到一段 AI 写的投研内容,大多数人的第一反应是从头到尾读一遍,看看有没有哪里不对劲。 这个动作几乎没有作用,原因很简单:编造出来的句子和抄自年报的句子,在文本表面没有任何区别。 它们同样具体、同样有单位、同样和上下文严丝合缝——事实上编造的那句往往更顺, 因为它就是按上下文推出来的,而真实数据经常有点别扭,有零有整,还带着一堆口径说明。

所以核验不能靠语感,只能靠分类。把材料按「这一类错了会怎样」和 「模型在这一类上最容易补全什么」两条线切开,不同的类走不同的动作: 有的必须回一手资料逐个查,有的必须找到原文逐字比,有的只需要补一个日期, 有的确认一下口径就行,还有的干脆可以放过。这套分类就是本页清单的全部内容。

第二个要解决的问题是时间。全查在很多场景下不现实,而抽查又常常抽得毫无章法—— 随手看三条觉得没问题就发出去了。抽检其实是有算术的:抽多少条、怎么抽、 抽完之后能得出什么结论,都不该凭感觉。本页的计算器就干这件事。

五档分类:不同内容需要的动作根本不是一回事

必须逐个回查。 财务数字、日期、人名与职务、持股比例、监管处罚,还有产能订单客户这类经营数据。 这几类的共同点是错了会直接改变结论,而且都是模型最容易「补全」的地方: 它对一家公司的量级有印象,于是能写出一个数量级正确、具体数值错误的数。 这一档没有捷径,必须打开定期报告、公告或监管机构官网,把那个值找出来比对。

必须核对原文。 所有带引号的直接引述,以及「据某某报道」这类转述来源。 引号在读者心里是极强的背书,而生成一段「那个人会怎么说」的话恰恰是模型最擅长的。 这一档的动作和数字不同:要找到被引的那份原文本身,逐字比对,确认它存在且完整。 核不到原文时唯一正确的处理是去掉引号、改成自己的转述并注明未核实。

必须标注时点。 「目前」「最新」「近期」「今年以来」,以及所有排名与地位表述。 这类词严格说不算编造,但它把「什么时候的事」这个关键条件藏了起来, 而读的人会默认是此刻。处理动作很轻:换成明确日期,注明数据截止到哪一天, 排名则补上统计口径与样本范围。轻,但不能省。

必须确认口径。 同比环比、合并与母公司、扣非与不扣非、跨期跨市场对比。 这一档最阴险:每个数字单独看都是对的,回查也查不出问题, 放在一起做出来的对比却是错的。基期被追溯调整过,增长率就变了; 两家公司用不同准则或不同币种,并排放进一张表就没有意义。 查这一档不能查数字,只能查口径声明。

可以放过。 通用概念解释、方法论描述、以及对你自己提供材料的整理改写。 这些内容在训练材料里高频且稳定,出错概率低,且一旦出错通常是明显的逻辑不通。 唯一要留意的是整理类任务里的「顺手补充」——模型可能把它自己知道的东西掺进你的材料, 抽查有没有出现原文里没有的内容即可。

抽检的算术:先分贵贱,再谈随机

时间不够时,把有限的核验次数平均分给所有条目是浪费,因为这些条目的出错代价差着数量级。 一条被引进结论的数字错了,整段结论作废;一条背景描述里的数字错了,读者顶多觉得别扭。 所以计算器的分配原则只有一条:贵条目优先全查,剩下的时间才拿去做随机抽样。 贵条目的判定标准也很简单——直接支撑结论的、你打算原样引用出去的、以及全部带引号的引述。

剩余部分用等距抽样:把剩下的条目平均切成若干段,每段抽一条,起点随机。 不建议凭手感挑着看,人挑出来的样本会系统性地偏向开头几段和那些「看起来可疑」的地方, 而编造的内容恰恰不看起来可疑。另外有一条规则值得单独执行: 一旦某段抽到错误,把该段的全部条目升级为全查——错误在文本里往往是聚集的, 一段里出现问题,同一段的其他条目通常来自同一次不靠谱的生成。

如果算下来时间连贵条目都覆盖不了,计算器会直接把这个事实摆出来。 这时候正确的反应不是把标准降下来抽两条意思一下,而是回头改任务范围, 让 AI 少写一点需要核实的内容——核验成本大致正比于需要回查的条目数, 而条目数是你在提需求的那一刻决定的。

抽到一条错,意味着什么

这里只需要两条统计直觉,不需要假设检验那一整套语言。

第一条:全对时能得出的结论比你以为的弱得多。一个常用的粗略口径是, n 次抽查一次错误都没出现,错误率的上界大约是 3/n。抽 20 条全对, 上界约 15%,一份 100 条的材料里可能还藏着十几条错;抽 5 条全对, 上界约 60%,等于什么都没证明。所以「我抽查了几条都没问题」这句话, 在样本很小的时候几乎不携带信息。想把上界压下来只有一个办法:多抽几条。

第二条:抽到一条错时,结论反而强得多。抽 20 条发现 1 条错, 错误密度大约是二十分之一,套到没查的 80 条上,预计还有 4 条错, 而且你不知道它们在哪一句。这就是「抽到一条错就该退回整份」的算术依据: 你要么把剩下 80 条全部查一遍,要么承认这份材料的每一句话都已失去默认可信度。 把抽到的那一条改掉然后继续用,是三种选择里最差的一种—— 材料看起来干净了,剩余风险一点没少,还多了一层「已经查过」的心理背书。

几个常见误用

让模型自己检查一遍就算核验。 自查能揪出内部矛盾——前后数字对不上、单位不一致——因为判断依据全在文本内部。 但编造的事实不具备内部矛盾,它本来就是按上下文推出来的。 核验的本质是引入外部信息,让同一个模型重读同一段文本,没有任何新信息进来。

把「查不到」当成「不重要」。 核不到出处的内容不是可以将就着用的内容,而是必须删掉或明确标注未核实的内容。 留着它并保持原有的表述强度,等于你替一句来源不明的话做了背书。

用扫描结果代替核验清单。 本页的扫描只是正则匹配,它不理解语义,会漏也会多标。 它的唯一用途是把「这份材料要查的东西多不多」变成一个数字,好让抽检计算有个输入。 真正决定查什么的是上面那五档分类,不是扫描出来的那几行。

核验完就丢掉过程。 半年后回头看一份材料,你需要知道的不是「当时结论是什么」, 而是「当时查了哪些、没查哪些、依据的是哪一版资料」。 没有这段记录,已核验和未核验的部分会混在一起,整份材料的可信度重新归零。

边界与本工具的假设

本工具不判断内容真假,也没有能力判断——它不联网、不调用任何 AI 接口, 提供的只是分类规则与抽样算术。抽检部分假设错误在材料里大致均匀分布, 而真实情况往往是聚集的:同一段、同一类数据可能一起出错。 聚集意味着等距抽样有可能整段漏过,所以「某段抽到错就把该段升级为全查」这条规则不能省。 清单里「回到哪里核」写的是资料类型而不是具体网址, 因为各市场、各年份的披露入口不同,写死一个地址早晚过期,反而误导人。

风险提示:核验通过只说明抽查范围内未发现错误,不代表材料整体无误,更不代表其结论成立。 任何数据请以公司公告、定期报告与监管机构公布的原文为准。 本工具仅为测算演示与流程留痕之用,不判断任何标的,不发出买卖信号, 不构成投资建议,也不承诺任何收益。

常见问题

6 条
为什么抽到一条错误,就该把整份退回重做,而不是把那一条改掉?
因为你抽查的目的从来不是把抽到的那几条改对,而是估计整份材料的错误密度。假设一份材料有 100 个需要核实的条目,你抽了 20 条,发现 1 条是错的。这说明错误密度大约是二十分之一,把这个密度套到没查的 80 条上,预计还有 4 条错。关键在于:你不知道那 4 条在哪一句。改掉抽到的那一条之后,材料看起来干净了,实际上剩下的风险一点没少,反而因为「已经查过」而更容易被当成可信内容引用出去。这时你只有两条路:要么把剩下 80 条全部查一遍,要么承认这份材料已经失去默认可信度。前者的成本通常比让 AI 重写一次高得多,尤其是当错误密度提示生成方式本身有问题时——重写换个更窄的任务范围,往往比逐条纠错便宜。反过来看,如果抽 20 条全对,你能得出的结论其实很弱:按常用的粗略口径,n 条全对只能说明错误率大概不高于 3/n,也就是 15%,一份 100 条的材料里可能还有十几条错。抽查通过说明不了「没错」,只说明「错得没那么密集」。
哪些数字最容易被编造?有没有优先级?
按出错概率与出错代价一起排,优先级最高的是几类具体、连续、且披露口径不统一的数字。第一类是财务明细:不是营收净利这种被反复提及的大数,而是毛利率、分部收入、应收账款周转这些颗粒更细的项——模型对量级有印象,于是能写出一个数量级正确、具体数值错误的数,这恰恰是最难被察觉的错法。第二类是比例:持股比例、市占率、产能利用率,比例是连续量,给一个「差不多」的值几乎没有心理障碍。第三类是时间敏感的事实:高管职务、股权结构、监管进展,它们会随时间变化,而模型的印象往往停在某个更早的时点,把已离任的人写成现任是这类内容里最常见的硬伤。第四类是「本该有个来源」的地方:某机构预测、行业协会数据、某某报道——当上下文需要一个出处时,填空的压力最大。相对安全的是通用概念解释和方法论描述,它们在训练数据里高频且稳定,出错概率低,而且一旦出错通常是明显的逻辑不通,你自己一眼能看出来。所以核验时间应当集中在前四类,把概念解释也逐条回查是把宝贵的时间花错了地方。
带引号的直接引述为什么要单独列一档?
因为引号在读者心里是一种极强的背书。看到「据管理层在业绩说明会上表示」加一个引号,绝大多数人会默认这句话是原话,连带着对整段内容的信任度都会提高一档。而生成一段「那个人会怎么说」的话,恰恰是语言模型最擅长的事——语气、立场、行业黑话都能像得惊人,但那句话可能根本不存在,也可能存在却被截断改了意思(把带条件的表述掐掉条件,是比凭空编造更隐蔽的一种错法)。这一档的核验动作和数字不一样:数字是回一手资料找那个值,引述是必须找到被引的那份原文本身,逐字比对,确认这句话确实存在、且完整。找不到原文时唯一正确的处理是把引号去掉、改成你自己的转述,并注明未核实——保留引号却核不到原文,等于替一句来源不明的话背书。同样的逻辑适用于「据某某报道」这类转述来源:来源名称听起来越权威,越容易让人跳过核实,而这类表述既可能真有其事,也可能只是对「这里应该有个出处」的填空。
我让它自己再检查一遍,它也承认改了几处,这样不行吗?
这一步有价值,但它解决的不是你以为的那个问题。让模型自查通常能揪出内部矛盾——前面说增长后面说下滑、两处数字对不上、单位前后不一致,这类问题它确实查得出来,因为判断依据全在文本内部。但编造出来的事实恰恰不具备内部矛盾:一个凭空生成的净利率和上下文是自洽的,甚至比真实数字更「顺」,因为它就是按上下文推出来的。让模型再读一遍,它读到的还是同一段自洽的文本,没有任何新信息进来,自然也就没有发现错误的通道。更麻烦的是,自查过程本身会输出一段「我已核对,未发现问题」的确认,这段确认对读者的心理作用很强,实际信息量却是零,反而会让人跳过真正的核验。判断标准可以简化成一句话:核验的本质是引入外部信息。回一手资料是引入外部信息,换一个模型交叉验证也算引入了一部分(不同的训练材料会在不同的地方出错),而让同一个模型重读同一段文本不是。所以自查可以留着当第一道筛子过内部矛盾,但它替代不了本页清单里那几档必须回查的动作。
核验成本太高,一份材料要查大半天,还有别的办法吗?
有,而且方向和大多数人想的相反:核验成本太高时,正确的做法不是降低核验标准,而是降低对 AI 的要求——让它少写一点需要核实的内容。这个思路的依据很直接:核验成本大致正比于材料里需要回查的条目数,而条目数是你在提需求时决定的。同一个任务,让它「写一篇公司经营情况分析」,它会自动补上一堆具体数字,每一个都要查;改成「我给你这三份材料,只根据材料里的内容整理成结构化要点,材料里没有的一律写未提及」,需要回查的条目数可能降一个数量级,剩下的核验动作也从「找一手资料」变成了「抽查有没有漏项或加料」。另外几个能压成本的做法:把「给我数据」换成「告诉我这个数据该去哪份文件的哪一节找」,让它做索引而不是做数据源;把需要具体数值的部分和只需要框架的部分拆成两次任务,前者你自己填数;以及在提示词里明确要求逐条标注来源与不确定项,没有来源的结论一律不写。本页的计算器如果告诉你时间连贵条目都覆盖不了,那就是一个明确的信号:该回去改任务范围了,而不是硬着头皮抽两条意思一下。
这个清单要怎么和提示词工具、流程工具配合用?
三者是同一条链路上的前中后三段,配合起来才省事。提示词工具在事前起作用:在提问阶段就把材料边界写清楚(只根据我给的材料回答)、要求逐条标注来源、要求把不确定的地方单独列成清单而不是混在正文里。做到这几点,产出的内容里需要回查的条目会明显变少,而且哪些要查是它自己标出来的,你不用再费劲去找。流程工具在事中起作用:把多个角色、多个步骤排成顺序,明确每一步用什么材料、产出什么、在哪一步做交叉验证——核验不是最后统一做一次,而是每一步的出口都设一道,否则错误会被下一步当成输入继续放大,等到最后再查已经分不清是哪一步出的问题。本页清单在事后起作用:拿到成品之后按五档分类、定抽检量、算可信度、留下核验记录。三者共同的前提是同一条纪律——AI 负责结构与效率,事实的最终来源永远是一手资料,这一点不因为工具链多完善而改变。

本工具仅为测算演示,不构成投资建议。计算结果受输入假设影响,实际情况请以官方规定与金融机构公布为准。

回到计算器