别问哪个模型最强,自己出一套题测它
- 用自己手上的材料出一套二十道左右的私有考题,半小时内跑完一个模型
- 从长文档理解、数字提取、拒答意愿、引用可核查性、指令遵循五个方向分别打分,并按错误类型而不是总分来判断能不能用
- 建立一张可复用的对比表,换模型、模型静默更新之后重跑同一套题,横向可比
你大概经历过这么一个循环。看到有人说某个模型「投研能力吊打其他家」,跟着换过去,用了两周,感觉好像也没多好,又看到另一篇说别家更新了、更强了,再换。换来换去,你手上其实一直没有一个答案:这玩意儿在我自己的活儿上,到底行不行?
问题出在你一直在用别人的结论。别人的结论有两个毛病:一是他测的东西跟你要干的事不是一回事——他可能在测写代码、测做数学题、测编故事,你要的是读一份几百页的年报还不出错;二是这类结论的保质期短得吓人,模型每隔一段时间就更新一次,有时候连名字都不改,你昨天的判断今天可能就不成立了。
所以这一节不告诉你选哪个。这一节教你出一套你自己的考题,半小时跑完一个模型,得出一张只对你有效、但三年后依然能用的对比表。
先说一件跟投资没关系的事
你要招一个助理,帮你整理资料。来了两个人,一个简历上写着「某某职业技能大赛全国第三」,另一个什么奖都没有。
你会因为那个第三名就直接录用吗?大概不会。你更可能的做法是:从自己桌上抽一叠真实的材料给他,说「你把这里面所有涉及付款条件的段落找出来,标上在第几页」,然后你自己核一遍。半小时之后你心里就有数了——不是他有多强,而是他在你这摊活儿上会犯什么错,那些错你能不能一眼看出来。
这件事的关键在最后半句。你招助理其实不怕他犯错,怕的是他犯了错你发现不了。一个会漏掉几段但从不瞎编的助理,比一个从不说「找不到」、总能给你凑出一段的助理,安全得多。
对你的投研意味着什么
把这个道理搬到投研上,有三个直接的后果,值得你在动手前想清楚。
第一,你要的不是「最强」,是「够用且错法可控」。 你让 AI 干的活儿,绝大部分是处理已经存在的信息——从年报里定位段落、把公告整理成表格、把术语翻成人话。这类活儿不需要天才,需要的是稳定和老实。一个总分很高但偶尔会自信地编一个数字给你的模型,在投研里比一个能力平平但一问三不知就明说的模型危险得多,因为前者的错误会顺利通过你的眼睛,进到你的估值表里。
第二,不同环节可以用不同的东西。 测试的目的不是评出一个冠军然后所有事都交给它,而是搞清楚哪一步交给谁。有的适合啃长材料,有的适合严格按格式吐表格,有的适合当抬杠对象给你挑毛病。这跟你不会让同一个人既做前台又做审计是一个道理。
第三,这套题是你的资产。 出一次,以后每次听说有新模型、或者你怀疑手上这个悄悄变了,你就拿同一套题重跑一遍。因为题目没变、材料没变、评分口径没变,两次结果才真的可比。这是整件事里最值钱的部分——你从「跟着别人的说法换来换去」,变成了「有自己的一把尺子」。
出题:材料从哪来,多大规模
先解决材料。用你自己手上、且你已经读懂了的东西。最合适的是你最近认真读过的一份年报或者招股说明书,加上同一家公司的几份公告。为什么必须是你读懂了的?因为评分要靠你,你得知道标准答案。
有两类材料不要用。一类是网上那种流传很广的经典案例文档,它很可能已经出现在模型训练用过的资料里,模型是「记得」而不是「读懂」,测出来的分数虚高。另一类是你自己也没吃透的材料,那样你会把「它答得听着挺对」误判成「它答对了」——这恰恰是这类工具最擅长制造的错觉,AI 能不能预测股价,先看清它到底在算什么 那一节讲的就是「说得像」和「算得准」中间隔着多远。
规模上,二十道左右就够,五个方向各三到五道。别贪多,题目一多你就不想跑第二遍了,这套东西的价值恰恰全在「能反复跑」上。评分你自己来,一个模型半小时之内应该能跑完并打完分。
还有一点值得先说清:考题用的年报公告都是已经公开的东西,粘到谁家的对话框里都无所谓。等你测完开始拿它干真活儿,材料里混进了尽调时记的纪要、或者你自己的持仓复盘,「它跑在谁的机器上」就成了另一个性质完全不同的问题——本地模型解决的是什么问题那节把材料分成了三级,粘贴之前三秒钟就能判断自己在第几级。
下面是五个方向,每个方向讲清楚测什么、怎么出题、怎么判分。
方向一:长文档理解——它是真读了,还是只读了个开头
测什么。 你把几百页的材料整个丢给它之后,它是不是真的把中间那些页也看进去了。这件事很关键,因为投研材料最要命的信息经常不在开头,而在附注里、在中段某个不起眼的小节里。
怎么出题。 从材料的开头、正中间、结尾各挑一个只在那一处出现过的具体事实,各出一道题。比如中间某节提到过某项资产的减值测试用了什么假设,你就问它这个假设是什么。三个位置的题目难度要尽量接近,这样对比才有意义。
再补一道对照题:同一个问题,你分两次问——一次只给包含答案的那十几页,一次给完整的全本。如果短材料答对、长材料答错,那说明问题出在「材料太长」上,不是出在它不懂。 这个区分很有用,因为解决办法完全不同:前者靠拆分材料就能救,后者救不了。
怎么判分。 分三档记:答对、说没找到、答错。注意第二档和第三档要分开记,别合并成「没答对」——「没找到」是可控的,你补一句提示就行;「答错」是危险的,你可能不会去查。
关于材料多长算长,这里给不了具体数字,因为各家的容量差着量级,而且还在变。你只要知道一件事:容量标称能装下,不等于装进去之后还能被同等对待。 材料越长,中段信息被稀释的风险越大,这是个普遍现象而不是某一家的毛病。怎么切分和投喂长材料,几百页的材料怎么喂给 AI 那节专门讲。
方向二:数字提取准确率——投研里最贵的一项
测什么。 从材料里抽数字,抄得准不准。这一项在投研里的分量远超其他,因为数字是会一路流进你估值表的。
怎么出题。 挑十到十五个数字,故意把难度铺开:
- 几个正文表格里明摆着的(基准难度)
- 几个藏在附注里、需要翻一层才能找到的
- 几个需要它对着两期数据自己算一下的,比如同比变化
- 至少一个单位有陷阱的,比如材料里写的是万元而你的问法用的是亿元
- 至少一个口径有陷阱的,比如同一个名目在合并报表和母公司报表里是两个数
怎么判分。 逐个跟原文对,然后按错误类型分类,这比总分重要得多:
| 错误类型 | 表现 | 危险程度 |
|---|---|---|
| 抄错位 | 抄成了相邻行或相邻期的数 | 中,对一遍能抓到 |
| 单位口径错 | 数字对,量级或范围不对 | 高,看着合理最容易漏 |
| 算错 | 取数对,加减乘除错 | 中,你自己复算能抓 |
| 凭空生成 | 材料里根本没有这个数 | 最高,你没法靠核对以外的手段发现 |
最后一类是红线。只要出现一次凭空生成,这个模型在你这儿就永久失去「数字免检」资格——不管它其他方面多好,它交出来的每个数字你都得回原文核。编造的数字长什么样、为什么你会看不出来,编造的财务数字长什么样,以及你为什么发现不了 拆得更细。
顺便说一句,认真做这类系统的人早就把这条当常识了。开源投研智能体项目 Vibe-Trading 里专门挂了核查模块,把报告里的数字抽出来跟原始数据逐个对,对不上就判不通过;还有个工具干脆只接收数字、自己不取数,算术全用高精度方式做,就为了让每一步都能复算。人家的默认假设就是「模型给的数字不可信」,你的测试无非是把这个假设在自己的材料上再验一遍。
方向三:拒答意愿——它敢不敢说「材料里没有」
测什么。 你问一个材料里根本没有答案的问题,它是老实说没有,还是给你编一段。
怎么出题。 三到四道,都问材料里确实不存在的东西:
- 一个不存在的会计科目或者业务板块
- 一个公司确实没有单独披露的分部数据,比如某条产品线单独的毛利率
- 一件材料截止日之后才可能发生的事
- 一个看起来很像该有、其实没有的东西,比如某个行业惯常披露但这家没披露的指标
最后一道最能看出问题。前几道太明显了,很多模型会警觉;最后一道因为「常识上应该有」,最容易诱发它自动补全。
同时要测反方向。 出两道材料里明明白白有答案的题,故意用一种不太常见的说法去问。如果它答「材料未提及」,那是过度拒答——这同样是个毛病,会让你白白错过材料里已有的信息,而且比编造更难察觉,因为「没找到」听起来像是谨慎。
怎么判分。 理想状态是四道不存在的题全说没有、两道存在的题全找到。现实中你更可能看到某种偏向:要么偏爱编,要么偏爱推。知道它偏哪边,比知道它总分多少有用得多——偏爱编的,你就得把每条结论都当草稿;偏爱推的,你就得学会换几种说法再问一遍。
方向四:引用可核查性——出处能不能核,比结论对不对更重要
测什么。 你要求它每条结论都标出处,然后你真的去核那个出处。
怎么出题。 挑五道有一定综合性的问题,比如「这家公司在材料里给自己的主要风险排了哪几条」,明确要求:每条结论后面附上依据的位置和原句。然后你逐条去材料里找。
怎么判分。 会遇到四种情况,价值天差地别:
- 出处准确,原句支持结论。 满分。这种模型可以放心当研究助手用,因为它的每句话你都能在三十秒内验掉。
- 出处准确,但原句撑不起那个结论。 它引的段落确实存在,但那段说的是另一件事,或者语气比它转述的弱得多——比如原文说「存在一定不确定性」,它写成「公司提示重大风险」。这是最需要你警觉的一类,因为核对动作看起来通过了,你会以为自己查过了。
- 出处是编的。 页码不存在,或者那一页讲的是完全无关的内容。这类反而好办,核一次就现形。
- 出处笼统到没法核。 只写「见年报相关章节」「根据公开披露」。这等于没给出处,判零分,别客气。
第二种情况值得单独说一句。它意味着你不能只核「有没有这句话」,你得核「这句话是不是这个意思」。这两个动作的成本差好几倍,但省不掉。核验动作具体该放在流程的哪一步、每一步核什么,核验动作该放在流程的哪个位置 那节有更细的安排。
方向五:指令遵循稳定性——同一句话,它守不守得住
测什么。 你给了明确的格式和边界要求,它能不能一直守着;同一个要求跑很多次,稳不稳。
怎么出题。 写一段带硬性约束的指令,比如:只输出表格,不要任何表格之外的文字;缺失的项一律填「未披露」,不许推算;不要加任何评价性的形容词。然后:
- 同一段指令跑五次,看五次里有几次完全守住。这一项测的不是能力是稳定性,一次跑不出来。
- 在长对话的后段再考一次。 前面聊了十几轮之后,再要求它按最初那个格式输出一次,看约束还在不在。投研里你经常是聊着聊着才要结果的,这个场景很真实。
- 测一次「不许做的事」。 比如明确写「只做摘录,不要给出任何买卖倾向的判断」,看它憋不憋得住。
怎么判分。 五次里守住几次,直接记比例。这一项和方向二一样有个红线:如果它连「缺失就填未披露、不许推算」都守不住,那它吐出来的任何表格你都不能直接用,因为你分不清哪个格子是抄来的、哪个格子是它自己补的。让它吐表格而不是散文的具体做法,在 让它吐表格,别让它写散文 里。
顺带一提,同一个问题问两遍答案不一样,本身是这类工具的固有性质而不是故障,同一个问题问两遍,答案为什么不一样 讲了为什么。这一项测的不是「能不能做到完全一致」,而是「波动会不会大到毁掉你的流程」。
把结果记成一张表
跑完之后,别只在心里留个「感觉还行」。做一张表,横着是模型和日期,竖着是五个方向,格子里填的不是分数,是错误类型。
测试日期:____ 材料:____(自己的年报/公告,勿换)
方向 结果记录要点
长文档理解 开头/中段/结尾各答对否;长短材料对照是否掉分
数字提取 错误分类计数:抄错位__ 单位口径__ 算错__ 凭空生成__
拒答意愿 不存在的题编了几道__ ;存在的题误答"未提及"几道__
引用可核查 准确且支持__ 准确但不支持__ 出处编造__ 笼统无法核__
指令遵循 五次全守住__次;长对话后段是否失守__
看这张表的方法,就一句话:先看有没有踩红线,再看它偏向哪种错。 红线只有两条——数字凭空生成、格式约束守不住。踩了任何一条,不是不能用,是用法必须降级:只让它做定位和摘录,所有数字回原文取,绝不让它的输出直接进你的表格。没踩红线的,你再看它偏向:偏爱编造的,你把核验重心放在「找出处」;偏爱笼统的,你把重心放在「追问细节」。
关于什么时候重跑:至少在两种情况下重跑同一套题——你听说手上这个更新了,以及你打算换一个。别的时候不用折腾。这里可以借一下量化工程里的一个习惯:开源框架 freqtrade 的机器学习模块里有个设置,规定模型训练完多久之后就不再允许它做预测,因为市场会变、模型学到的东西会过时,过时了就该闭嘴。你的测试结论也一样有保质期,只不过过期的不是模型,是你对它的印象。
坑:拿网上的排行榜当选型依据。 榜单测的题目跟你的年报没关系,而且模型经常在不换名字的情况下悄悄更新,你看到的排名可能测的是另一个版本。怎么避:只认自己那套题的结果,别人的结论最多当「值得去测一测」的线索。
坑:只测一次就下结论。 尤其是方向三和方向五,单次结果里运气成分很大。同一道题跑三次以上再记。
坑:题目泄漏给了模型。 别把标准答案跟题目放在同一段话里,也别在追问的时候不小心把答案说出来,否则后面的对比全废。
这套测试评的是信息处理能力,不是投资能力。一个五项全优的模型,也不会因此就能判断某家公司值不值得买——那两件事之间没有桥。凡是拿「模型评测得分高」推导出「所以它选的股票靠谱」的说法,都是偷换。本站所有内容只讲原理与方法,不构成任何投资建议,完整边界见 免责声明。
一点延伸:为什么这套方法不会过期
回头看这五个方向,你会发现它们没有一条依赖于当下的技术细节。不管以后模型能装多长的材料、参数变成多大、名字叫什么,只要你还是要拿它读年报,你就还是要关心:中段的信息它看没看见、数字有没有抄错、不知道的时候敢不敢承认、给的出处能不能核、说好的格式守不守得住。
这跟量化里评价一个信号的思路是一样的。开源量化平台 qlib 评价预测结果,从来不看「模型多先进」,只看预测出来的排序和事后真实的排序之间有多强的相关性——指标绑的是「你想要的结果」,不是「工具的样子」。 你这套考题也一样:它绑的是你的材料和你的活儿,所以工具换了它照样管用。
至于这些能力最终能帮你做成哪些具体的事、哪些事无论怎么测都帮不上,那是另一个话题了。你可以先记住一个粗糙但好用的分界:它擅长处理已经写在纸上的信息,不擅长生成还没发生的信息——你的考题,也应该全部出在前一半上。
小结
- 别问「哪个模型最强」,问「它在我的材料上会犯什么错、那些错我能不能发现」。前一个问题下个月就过期,后一个问题三年后还成立。
- 材料用你自己读懂过的年报和公告,别用网上流传的经典文档(可能已被模型记住);题目二十道左右,五个方向各三到五道,半小时能跑完。
- 五个方向:长文档理解(开头中段结尾各出一题,再加长短材料对照)、数字提取(按抄错位/单位口径/算错/凭空生成分类计数)、拒答意愿(问材料里没有的,同时反向测过度拒答)、引用可核查性(准确且支持/准确但不支持/编造/笼统无法核)、指令遵循稳定性(同一指令跑五次,并在长对话后段复测)。
- 两条红线:数字凭空生成、格式约束守不住。踩到任何一条不是不能用,是用法必须降级为只做定位摘录,数字一律回原文。
- 结果记成一张表,格子里填错误类型而不是分数。听说模型更新了、或者打算换一个,就拿同一套题重跑,横向才可比。
- 测出来的是信息处理能力,跟投资判断能力之间没有桥,别在两者之间画等号。
一句话总结:与其相信别人说哪个好用,不如拿你自己那份看过的年报出二十道题,看它敢不敢说「这里没写」。
本文为投资教育整理,关键数据与结论请结合下列权威来源验证。