AI 写出来的投研内容里,编造的部分和抄自年报的部分在文字上没有任何区别—— 都一样具体、一样自信。所以判断可信度不能靠通读,只能靠分类: 先分清哪些内容必须回一手资料,再在时间有限的前提下决定抽查多少条。 本工具全程在你的浏览器里运行,不上传任何内容,也不调用任何 AI 接口。
第一步(可选):数一数这份材料里有多少条要查
把 AI 的输出粘进来,工具会按关键词与数字模式做一次粗略扫描。 它不理解语义、也不判断对错,唯一的作用是把「这份材料要查的东西多不多」从感觉变成一个数字。 扫描结果宁多勿少,漏标比多标危险。
第二步:按类别决定怎么核
已确认 0/16 项勾选表示「这一类我已经按要求处理过了」。勾选状态只留在本页面,不上传、不保存, 刷新即清空——真正要留档的是下面生成的那段核验记录。
必须逐个回查
0/6打开一手资料(定期报告、公告、监管机构官网),把这个数字或这条事实找出来,逐字比对。
这几类内容有一个共同点:错了会直接改变结论,而且模型最容易在这里「补全」出一个看起来合理的值。
必须核对原文
0/2找到被引述的那份原文本身,逐字比对引号内的内容,确认这句话确实存在、且没有被截断改意。
引号是一种极强的可信度背书,读者会默认它是原话。一旦引号里的内容是拼接出来的,整份材料的信誉全部作废。
必须标注时点
0/2把「目前」「最新」「近期」这类词换成明确日期,并注明数据截止到哪一天。
这类词没有错误可言,但也没有信息量——它把「什么时候的事」这个关键条件藏了起来,读的人会默认是今天。
必须确认口径
0/3确认基期、会计口径、币种与单位是否一致:同比比的是谁、合并还是母公司、扣非还是不扣非、有没有追溯调整。
口径不一致时,每个数字单看都是对的,放在一起做出来的对比却是错的——这种错最难被发现,因为回查单个数字查不出来。
可以放过
0/3读懂即可,看逻辑自不自洽,不必回查。
通用概念与方法论是模型训练数据里高频、稳定的部分,出错概率低,且错了你自己一眼能看出来。把核验时间花在这里是浪费。
第三步:时间有限时,该抽检多少条
贵条目指直接支撑结论、你打算原样引用的那些数字,以及全部带引号的引述——这些必须全查。 剩 下的才做抽样。单条耗时按你自己的实际速度填,不同资料的可及性差别很大,页面不预设任何数字。
- 贵条目全查 12 条(20%)
- 随机抽查 10 条(16.7%)
- 未核验 38 条(63.3%)
按什么规则抽
- 先把 12 条贵条目全部查完:直接支撑结论的数字、你打算原样引用的数字、以及任何带引号的引述,一条都不能跳。
- 剩下的 48 条做等距抽样:每 4 条抽 1 条,共抽 10 条。起点随机选,不要固定从第一条开始。
- 抽样点要跨段落均匀分布。集中抽开头几段是最常见的错误做法——它只能证明开头没问题。
- 一旦某段抽到错误,把该段的全部条目升级为全查,并把这一段的错误计入下面的判断。
- 每查一条就记下结论,别凭记忆汇总——核验记录本身就是这份材料的可信度凭证。
第四步:查完之后,这份材料还能不能用
把你实际查了多少条、其中发现几条错填进来。这里给出的不是「合格 / 不合格」的判决, 而是把抽检结果翻译成对未抽查部分的推断——你真正需要知道的是「没查的那些里还可能有多少条错」。
按这个上界推,没被抽到的 38 条里最多可能还藏着约 6 条错。样本越小,这个上界越宽松——抽 5 条全对几乎什么都证明不了。想把上界压下来,只有一个办法:多抽几条。
第五步:把核验过程留档
下面这段纯文本随你的勾选和输入实时更新,全选复制即可贴进笔记或邮件。 留档的意义不在于证明材料没错,而在于半年后你还知道:当时查了哪些、没查哪些、依据的是哪一版资料。
风险提示
- 本工具不判断内容真假,它只提供分类规则与抽样算术。判断真假的唯一办法是回到一手资料逐条比对。
- 抽检全部通过不等于材料无误,只说明错误率大致低于某个上界;样本越小,这个上界越宽松。
- 粗略扫描基于关键词与数字模式,会漏也会多标,不能当作核验清单本身使用。
- 本工具不调用任何 AI 接口、不联网、不上传你粘贴的任何内容,全部计算在你的浏览器里完成。
- 本工具仅为流程演示与学习用途,不判断任何标的,不发出买卖信号,不构成投资建议,也不承诺任何收益。
教育演示:清单分类依据的是「错了会不会改变结论」与「模型在哪里最容易补全」, 抽检部分用的是等距抽样与错误密度外推。本工具仅为测算演示,不构成投资建议。
怎么用
6 步- 把材料粘进来数一数:先把 AI 写的那段内容整段粘进扫描框。工具按关键词与数字模式做一次粗略统计,告诉你里面有多少个数字、多少处引号、多少个「目前」。这一步不判断对错,只是把「要查的东西多不多」从模糊感觉变成一个具体数字。
- 按五档分类,而不是逐句通读:通读是最没用的核验方式,因为编造的句子和真实的句子读起来一模一样。改成按类别处理:财务数字、日期、人名职务、持股比例、监管处罚必须逐个回查;带引号的引述必须找到原文比对;「目前」「最新」必须换成明确日期;同比环比必须确认口径;通用概念与方法论可以放过。
- 标出贵条目:贵条目指直接支撑结论、你打算原样引用出去的那些数字,以及全部带引号的引述。它们必须全查,没有商量余地——一条贵条目错了,你基于它写的整段结论都要作废。把贵条目的条数单独填进计算器。
- 填时间,让工具替你做取舍:填上你能承受的核验总时间和平均每条耗时。工具先扣掉贵条目全查所需的时间,剩下的才拿去做抽样,并给出等距抽样的间隔。如果时间连贵条目都覆盖不了,它会直接告诉你——那时候该做的不是降低核验标准。
- 查完把结果填回去:填上你实际查了多少条、其中发现几条错。工具会把这个结果翻译成对未抽查部分的推断:全对时错误率大致不高于多少,抽到错时没查的部分里预计还藏着几条。这一步才是抽检真正的产出。
- 复制核验记录存档:最下面那段纯文本随你的勾选实时更新,全选复制贴进笔记即可。它记的不是「这份材料没错」,而是「当时查了哪些、没查哪些、依据的是哪一版资料」——半年后回头看,这个信息比结论本身更值钱。
通读是最没用的核验方式
拿到一段 AI 写的投研内容,大多数人的第一反应是从头到尾读一遍,看看有没有哪里不对劲。 这个动作几乎没有作用,原因很简单:编造出来的句子和抄自年报的句子,在文本表面没有任何区别。 它们同样具体、同样有单位、同样和上下文严丝合缝——事实上编造的那句往往更顺, 因为它就是按上下文推出来的,而真实数据经常有点别扭,有零有整,还带着一堆口径说明。
所以核验不能靠语感,只能靠分类。把材料按「这一类错了会怎样」和 「模型在这一类上最容易补全什么」两条线切开,不同的类走不同的动作: 有的必须回一手资料逐个查,有的必须找到原文逐字比,有的只需要补一个日期, 有的确认一下口径就行,还有的干脆可以放过。这套分类就是本页清单的全部内容。
第二个要解决的问题是时间。全查在很多场景下不现实,而抽查又常常抽得毫无章法—— 随手看三条觉得没问题就发出去了。抽检其实是有算术的:抽多少条、怎么抽、 抽完之后能得出什么结论,都不该凭感觉。本页的计算器就干这件事。
五档分类:不同内容需要的动作根本不是一回事
必须逐个回查。 财务数字、日期、人名与职务、持股比例、监管处罚,还有产能订单客户这类经营数据。 这几类的共同点是错了会直接改变结论,而且都是模型最容易「补全」的地方: 它对一家公司的量级有印象,于是能写出一个数量级正确、具体数值错误的数。 这一档没有捷径,必须打开定期报告、公告或监管机构官网,把那个值找出来比对。
必须核对原文。 所有带引号的直接引述,以及「据某某报道」这类转述来源。 引号在读者心里是极强的背书,而生成一段「那个人会怎么说」的话恰恰是模型最擅长的。 这一档的动作和数字不同:要找到被引的那份原文本身,逐字比对,确认它存在且完整。 核不到原文时唯一正确的处理是去掉引号、改成自己的转述并注明未核实。
必须标注时点。 「目前」「最新」「近期」「今年以来」,以及所有排名与地位表述。 这类词严格说不算编造,但它把「什么时候的事」这个关键条件藏了起来, 而读的人会默认是此刻。处理动作很轻:换成明确日期,注明数据截止到哪一天, 排名则补上统计口径与样本范围。轻,但不能省。
必须确认口径。 同比环比、合并与母公司、扣非与不扣非、跨期跨市场对比。 这一档最阴险:每个数字单独看都是对的,回查也查不出问题, 放在一起做出来的对比却是错的。基期被追溯调整过,增长率就变了; 两家公司用不同准则或不同币种,并排放进一张表就没有意义。 查这一档不能查数字,只能查口径声明。
可以放过。 通用概念解释、方法论描述、以及对你自己提供材料的整理改写。 这些内容在训练材料里高频且稳定,出错概率低,且一旦出错通常是明显的逻辑不通。 唯一要留意的是整理类任务里的「顺手补充」——模型可能把它自己知道的东西掺进你的材料, 抽查有没有出现原文里没有的内容即可。
抽检的算术:先分贵贱,再谈随机
时间不够时,把有限的核验次数平均分给所有条目是浪费,因为这些条目的出错代价差着数量级。 一条被引进结论的数字错了,整段结论作废;一条背景描述里的数字错了,读者顶多觉得别扭。 所以计算器的分配原则只有一条:贵条目优先全查,剩下的时间才拿去做随机抽样。 贵条目的判定标准也很简单——直接支撑结论的、你打算原样引用出去的、以及全部带引号的引述。
剩余部分用等距抽样:把剩下的条目平均切成若干段,每段抽一条,起点随机。 不建议凭手感挑着看,人挑出来的样本会系统性地偏向开头几段和那些「看起来可疑」的地方, 而编造的内容恰恰不看起来可疑。另外有一条规则值得单独执行: 一旦某段抽到错误,把该段的全部条目升级为全查——错误在文本里往往是聚集的, 一段里出现问题,同一段的其他条目通常来自同一次不靠谱的生成。
如果算下来时间连贵条目都覆盖不了,计算器会直接把这个事实摆出来。 这时候正确的反应不是把标准降下来抽两条意思一下,而是回头改任务范围, 让 AI 少写一点需要核实的内容——核验成本大致正比于需要回查的条目数, 而条目数是你在提需求的那一刻决定的。
抽到一条错,意味着什么
这里只需要两条统计直觉,不需要假设检验那一整套语言。
第一条:全对时能得出的结论比你以为的弱得多。一个常用的粗略口径是, n 次抽查一次错误都没出现,错误率的上界大约是 3/n。抽 20 条全对, 上界约 15%,一份 100 条的材料里可能还藏着十几条错;抽 5 条全对, 上界约 60%,等于什么都没证明。所以「我抽查了几条都没问题」这句话, 在样本很小的时候几乎不携带信息。想把上界压下来只有一个办法:多抽几条。
第二条:抽到一条错时,结论反而强得多。抽 20 条发现 1 条错, 错误密度大约是二十分之一,套到没查的 80 条上,预计还有 4 条错, 而且你不知道它们在哪一句。这就是「抽到一条错就该退回整份」的算术依据: 你要么把剩下 80 条全部查一遍,要么承认这份材料的每一句话都已失去默认可信度。 把抽到的那一条改掉然后继续用,是三种选择里最差的一种—— 材料看起来干净了,剩余风险一点没少,还多了一层「已经查过」的心理背书。
几个常见误用
让模型自己检查一遍就算核验。 自查能揪出内部矛盾——前后数字对不上、单位不一致——因为判断依据全在文本内部。 但编造的事实不具备内部矛盾,它本来就是按上下文推出来的。 核验的本质是引入外部信息,让同一个模型重读同一段文本,没有任何新信息进来。
把「查不到」当成「不重要」。 核不到出处的内容不是可以将就着用的内容,而是必须删掉或明确标注未核实的内容。 留着它并保持原有的表述强度,等于你替一句来源不明的话做了背书。
用扫描结果代替核验清单。 本页的扫描只是正则匹配,它不理解语义,会漏也会多标。 它的唯一用途是把「这份材料要查的东西多不多」变成一个数字,好让抽检计算有个输入。 真正决定查什么的是上面那五档分类,不是扫描出来的那几行。
核验完就丢掉过程。 半年后回头看一份材料,你需要知道的不是「当时结论是什么」, 而是「当时查了哪些、没查哪些、依据的是哪一版资料」。 没有这段记录,已核验和未核验的部分会混在一起,整份材料的可信度重新归零。
边界与本工具的假设
本工具不判断内容真假,也没有能力判断——它不联网、不调用任何 AI 接口, 提供的只是分类规则与抽样算术。抽检部分假设错误在材料里大致均匀分布, 而真实情况往往是聚集的:同一段、同一类数据可能一起出错。 聚集意味着等距抽样有可能整段漏过,所以「某段抽到错就把该段升级为全查」这条规则不能省。 清单里「回到哪里核」写的是资料类型而不是具体网址, 因为各市场、各年份的披露入口不同,写死一个地址早晚过期,反而误导人。
风险提示:核验通过只说明抽查范围内未发现错误,不代表材料整体无误,更不代表其结论成立。 任何数据请以公司公告、定期报告与监管机构公布的原文为准。 本工具仅为测算演示与流程留痕之用,不判断任何标的,不发出买卖信号, 不构成投资建议,也不承诺任何收益。
常见问题
6 条为什么抽到一条错误,就该把整份退回重做,而不是把那一条改掉?
哪些数字最容易被编造?有没有优先级?
带引号的直接引述为什么要单独列一档?
我让它自己再检查一遍,它也承认改了几处,这样不行吗?
核验成本太高,一份材料要查大半天,还有别的办法吗?
这个清单要怎么和提示词工具、流程工具配合用?
本工具仅为测算演示,不构成投资建议。计算结果受输入假设影响,实际情况请以官方规定与金融机构公布为准。