← 返回教程库

什么活值得用最贵的模型,什么活用最便宜的就够了

最后更新 2026-08-19
📚 量化与 AI 投研 📖 AI 投研实操 ⏱ 约 14 分钟 R1 · 低风险
你将学到
  • 用「错误的可发现性」而不是「任务难度」给投研流程的每一步分档,听完能自己把手上的流程过一遍
  • 说清为什么跨期口径判断这类活必须用最强的模型——不是因为它难,是因为它错了会无声地污染下游全部结论
  • 掌握三个把高危环节「降档」的动作,让你在不加钱的前提下把看不见的错误变成看得见的错误

你把三十份年报丢进去,让 AI 帮你把每家近三年的营业收入、毛利率、经营性现金流抠成一张表。跑完你花了两个小时逐格核对,发现提取那部分几乎没出错——数字对得上,格式也整齐。

真正出问题的是最后那一栏。你顺手让它加了一列「同比是否可比」,它每家都写了一句话,读起来都很在理。直到某天你自己翻原文,才发现有一家去年年中并进来一块新业务,收入基数根本不是一个东西,而它那句话写的是「口径一致,可直接比较」。

这两个错误的代价,差了不止一个量级。可你在选模型的时候,是把整个流程当一件事、用同一档模型跑完的。

这一节要换掉你分配预算的那把尺子。

生活层:装修的时候,钱该花在哪一道工序上

想想装修。搬材料、砌一堵不承重的隔墙、刷漆——这些活儿要是干砸了,你走进屋子当场就看见:墙歪了、漆色不匀、砖缝不齐。你有的是机会返工,代价就是重做一遍。

另一类活是水电走线、承重结构改动、防水层。这些干砸了,当天看不出来。墙一封,一切光鲜。你要等到三个月后楼下渗水、或者两年后想改个插座才发现线是怎么走的。到那时候,要拆掉的是压在它上面的全部东西。

一个有经验的人怎么分配预算?他不是按「哪道工序累」分,也不是按「哪道工序花的工时多」分。他按这道工序干砸了,我什么时候能发现、发现的时候要连带拆掉多少来分。刷漆可以找便宜的,防水必须找最贵最靠谱的——哪怕防水这活儿本身比刷漆还简单。

判据不是难度,是可发现性。 这句话原样搬到 AI 投研上,就是这一节的全部内容。

投资层:你的流程里,哪几步是「防水层」

先把这条判据翻译成你真实会做的事。

第一类,错了你一眼看得见。 从财报 PDF 的表格里把「营业收入」那一行的三个数字抠出来;把一段公告里所有的日期挑出来;把十几个季度的数据整理成统一列名的表。这类活的共同点是:输出能和原文逐字对上。它抠出来的数如果是编的,你把光标挪到原文那一栏,两秒钟就知道了。

第二类,错了你抽查能看见。 把三十份公告按时间排成一条事件线;把一段业绩说明会的问答整理成要点;把一份研报的观点归成三条。这类活没法逐字核,但你随机挑几条回原文一对,就能大致判断它靠不靠谱。错误是有痕迹的,只是找痕迹要花你的时间。

第三类,错了你根本看不见,而且它会往下传。 「这家公司今年的营业收入和去年可比吗」——要答这个,得知道并表范围变没变(并表范围就是把哪几家子公司的账合进来一起算),得知道会计准则那年调没调,得知道有没有一块业务被划成了终止经营。这一句判断错了,你后面算出来的所有同比增速、所有基于收入的估值倍数、所有靠增速做的筛选,全是错的,而且每一个都长得很正常

再举几个同属第三类的:「这两家公司的毛利率能不能直接横向比」(成本口径可能不同)、「这段管理层表述相比上一期是变强还是变弱了」、「这条监管措辞的变化对这个行业意味着什么」。它们的共同点是:产出是一个判断,而不是一段可以回原文对照的摘录。判断没有原文可对——你要验证它,成本几乎等于自己重做一遍。

现在把三类和钱对上:

  • 第一类:用便宜的、快的。省下来的钱和时间,拿去写核对脚本、拿去多跑几遍交叉验证。
  • 第二类:中间档,配一个明确的抽查比例,抽查这件事必须真的做。
  • 第三类:用你手上能拿到的最强的那一档,并且还要额外加要求。

你花大价钱买的不是「更准」,是「在你看不见的地方少犯错」。 在你看得见的地方,便宜模型犯的错都会被你抓住,那部分错误的实际成本接近于零。

机制层:为什么第三类的错误这么贵

污染半径

第一类错误的影响范围是它自己:一个数错了,就是一个数错了。你后面用到这个数的地方会跟着错,但错误本身是局部的、可定位的——你顺着那个离谱的数字往回查,一定能查到源头。

第三类错误的影响范围是下游的全部结论,而且它不留痕迹。「口径一致」这四个字一旦被写进你的表,后面所有基于这张表的计算都在一个错误的前提上跑,每一步的算术都是对的,每一个中间结果看起来都合理。你没有任何一个数字会显得离谱,因为离谱的不是数字,是假设

这就是它值得溢价的原因。不是因为它难,是因为它错了之后,你连「哪里出了问题」这个问题都问不出来。

越靠近「总结」,越危险

概念库里那篇 让大模型直接做交易决策,这条路现在走到哪了 里提过一个反直觉的观察:在多角色协作的系统里,编数字最厉害的往往不是分析岗,是总结岗。分析岗手里有工具、有原始材料,编的动力小;总结岗只拿到几段文字,为了让报告显得完整,它会自己把缺口补上。

这个观察和这一节的分档是同一件事的两面。离一手材料越远的环节,产出越是「判断」而不是「摘录」,可发现性越低,就越应该往第三类放。 你如果只有预算给一个环节升配,别给读财报那一步,给写结论那一步。

工程上,这件事是被显式设计出来的

这不是我个人的偏好,认真做这类系统的人已经把它写进结构里了。

在开源 AI 投研智能体项目 Vibe-Trading 里(智能体就是能自己调工具、分几步把一件事做完的 AI 程序,不是只会一问一答的聊天框),一个多角色编队里的每个角色都有一份规格说明,里面除了岗位职责、可用工具、最多允许迭代几轮之外,还有一个字段专门用来单独指定这个角色用哪个模型,不指定就落到全局默认。

一个字段而已,但它的存在本身就是个结论:做这套东西的人从一开始就假定,同一条流程里的不同环节,值得用不同的模型。 如果他们认为「全用最强的」是对的,这个字段根本不需要存在。

同一个项目里还有一处更细的:图片转文字这件事有自己独立的模型配置项,和主流程的模型分开。图片转文字是典型的第一类活——原图就在那儿,它认错了字你对一眼就知道。有意思的是它的提示词设计注释,里面明确要求:看不太清的地方标成「不确定」,完全认不出的标成「无法辨认」,不许猜。

这一条值得停下来品。它做的事情是把模型的不确定性从隐形变成显形。默认情况下,模型对着一张糊掉的表格也会给你一个数,你完全看不出那个数是读出来的还是猜出来的;加了这条规则之后,猜的地方会自己举手。

同样的思路在量化工程里也有:开源框架 freqtrade 的机器学习模块会衡量当前这组输入离训练时见过的数据有多远,太远就把这次预测直接丢掉——宁可不给答案,也不给一个没有依据的答案。本卷 AI 能不能预测股价,先看清它到底在算什么 里详细讲过这个设计。

这两处放在一起,指向同一个手段:与其花钱买一个更少犯错的模型,不如先想办法让它犯的错自己暴露出来。

降档:不加钱,把看不见的错误变成看得见的

分档不是宿命。第三类的活里,有相当一部分是可以被你改造成第一、二类的——改造完,你就能用便宜档跑,而且比原来用最强档还安全。

动作一:要求它交出处,而且要交原文片段。 「口径一致」这句话你没法验;但如果它必须同时贴出附注里那段关于并表范围的原文、并标明在第几页,这个判断就变成了「一段可对照的引用 + 一句结论」。你核对引用的成本是十几秒,核对结论的成本是重做一遍。怎么把出处真的逼出来、以及怎么识别它编出来的假出处,是 怎么逼它把出处交出来 那一节的正题。

动作二:把「结论题」拆成「若干道提取题 + 你自己下的判断」。 别问「今年和去年可比吗」。改成三个提取题:并表范围这一期有没有变化,原文怎么写的;会计政策有没有变更,原文怎么写的;有没有终止经营,原文怎么写的。这三问全是第一类活,便宜模型就能做,而且你一眼能核。最后那句「所以可比/不可比」,你自己下。

这个改造的实质是:把你无法验证的那一步,从模型手里拿回到你自己手里。 你没有多花任何算力,风险却降了一个档。

动作三:给它一个说「不知道」的出口,并且让这个出口有明确格式。 默认情况下模型永远会给你一个答案,因为它被设计成永远有话说。你得在要求里写死:材料里找不到依据的,必须原样写「材料中未提及」,不许推断。有了这条,缺失就从「被一句圆滑的话盖住」变成了「一个你能搜出来的固定标记」。这类要求怎么写进提示词才不会被绕开,见 一个好的投研提示词,有四个东西不能少

几个容易踩的坑

🚧 避坑

坑一:按「任务看起来难不难」分配预算。 读一份三百页的年报看起来很难,但那是体力活,错了你能发现;判断一句话里的口径变化看起来很小,却是防水层。怎么避:给每一步只问一句——「这一步错了,我在哪个环节会发现?」答不上来的,就是第三类。

🚧 避坑

坑二:一刀切全用最强的,然后觉得安全了。 这么做未必贵到不可接受,真正的问题是它掩盖了你没有核对机制这件事。最强的模型在第三类任务上照样会错,只是错得少一点、错得更像话一点。你把预算当成了保险,但它不是保险——没有可发现性的地方,再强的模型也是在裸奔,只是跑得好看些。

🚧 避坑

坑三:「便宜模型初筛 + 强模型终审」听着完美,但有个洞。 初筛漏掉的东西,终审永远看不见——被筛掉的材料根本不会进入终审的视野。漏检是典型的不可发现错误。 怎么避:初筛这一步的口径要刻意放宽,宁可多留一批让终审去否,也不要让它替你做排除;另外定期随机抽一些被筛掉的,回头看看漏没漏。

🚧 避坑

坑四:只算「跑一遍花了多少钱」。 真实成本里更大的一块是你的核对时间,以及错误漏出去之后的返工。一个便宜但需要你逐条核的方案,未必比一个贵但可以抽查的方案划算。把这两项一起记进账,很多选择会反过来。

一个今天就能做的动作

把你现在这套 AI 投研流程写成一张步骤清单,一步一行,别偷懒合并。

然后每一行后面写一句话,回答同一个问题:这一步如果错了,我在哪一步、大概多久之后会发现?

  • 「下一步核对时立刻发现」→ 第一类,可以往便宜档降。
  • 「抽查几条能发现」→ 第二类,那就把抽查真的排进流程,别只是想想。
  • 「答不上来」或者「等到某天翻原文才发现」→ 第三类。

数一数第三类有几行。多数人第一次数完会有点意外——它比你以为的多,而且往往集中在流程末尾那几步,也就是你最不注意、最想图省事的地方。

分完档之后,接下来的问题是怎么验证你分对了。这不需要一上来就建一套很正式的评估体系:挑几十条你手上已有标准答案的样本,同一个环节分别用不同档的模型各跑一遍,比一比差多少。差不多,那这一步就该降档;差得明显,说明它确实是第三类,那份钱别省。怎么组织这种小规模比较、以及哪些指标看着有用其实没用,见 怎么评测一个模型在你的活上到底行不行

小结

  • 分配预算的判据是错误的可发现性,不是任务难度。装修的道理原样适用:刷漆可以省,防水不能省,哪怕防水更简单。
  • 三档:逐字可核(提取、格式转换)用便宜档;抽查可核(整理、归纳)用中间档并真的抽查;无声传播(跨期口径、横向可比、因果判断)用你能拿到的最强档。
  • 第三类之所以贵,是因为它的错误没有痕迹——每个数字都正常,错的是假设。而且越靠近「总结、综合」的环节,越属于这一类。
  • 工程实践已经把这件事结构化了:多角色系统里每个角色可以单独指定模型;机械型任务被要求把「看不清」「无法辨认」显式标出来。让不确定性显形,比换一个更强的模型更根本。
  • 降档比升配更划算:要原文片段而不是结论、把结论题拆成提取题自己下判断、给它一个格式固定的「不知道」出口。三个动作都不花钱,却能把风险降一整档。
  • 别只算跑一遍的花费;核对时间和返工成本才是大头。

一句话记住:钱要花在你看不见的地方——你能一眼抓住的错误,不值钱;你抓不住的那种,才是真正的开销。

本文所引开源项目的说明均来自上述源码快照,是阅读代码与文档得出的机制描述,不是运行结果,也不代表任何做法能带来收益。本站内容为投资教育,不构成任何投资建议,边界见 免责声明

内容有错、看不懂、或想看下一篇?告诉我们 →

本文为投资教育整理,不构成任何投资建议;不荐个股/基金、不预测点位、不承诺收益。关键数据与结论请结合权威来源自行验证,并见风险免责声明