← 返回教程库

它一次能读多少字,决定了你该怎么喂财报

最后更新 2026-08-19
📚 量化与 AI 投研 📖 AI 投研实操 ⏱ 约 14 分钟 R1 · 低风险
你将学到
  • 判断一份材料该不该整份塞进去:先看装不装得下,再看你要的信息落在材料的哪个位置
  • 用「三次埋点」的小实验,自己测出手里这个工具在长材料的开头、中间、结尾各扫得有多仔细
  • 材料超量时按四个动作改喂法:按问题取材料、一次一问、重要内容放两端、每轮重述口径

你把某消费公司的年报 PDF 拖进对话框,转了一会儿,它说读完了。你先问了句收入变化,答得挺顺,数字也对得上。你再追问一句:附注里关于关联交易的部分怎么说的?

它回你:文中未见相关披露。

你自己翻回去,那部分白纸黑字写在几百页里的某一处,标题都带着「关联方及关联交易」几个字。

这一刻很多人的反应是「这 AI 不行」,或者「它是不是只读了前几十页」。两个猜测都不完全对,但后一个更接近真相。这一篇要讲的就是这件事:它一次到底能吃进去多少字,吃进去之后是不是每一页都同样认真地看过,以及吃不下的时候你该改成什么姿势喂。

先用一件生活里的事讲明白

想象你雇了个人帮你看材料,他有两条很怪的规矩。

第一条规矩:他只在一张桌子上干活。 你递给他的所有纸,必须能同时摊在这张桌子上,摊不下的他不接——不是先看一半再看另一半,是压根不收。桌子的大小是固定的,不同的人桌子大小不一样,有人的桌子能摊下一整摞,有人的只能摊下薄薄一叠。

第二条规矩更要命:桌子上的纸,他看得并不匀。 他的眼睛习惯性地落在最上面那几张和最下面那几张,中间那一大摞,他是扫过去的。你问他最上面写了什么,他答得清清楚楚;你问他最下面写了什么,他也答得上来;你问他中间某一张的某一行,他有时说得出来,有时就说「没看到这个内容」。

注意这两条规矩的性质完全不同。第一条是硬边界——摊不下就是摊不下,你递多了他会明确告诉你「拿走点」。第二条是软塌陷——他不会告诉你哪几张他扫得潦草,他自己都未必知道。他给你的回答听起来一样自信、一样流利。

这两条规矩合起来,就是「上下文窗口」这件事对你的全部影响。上下文窗口,说白了就是这台机器一次能同时看见多少字,超出的部分它看不见。桌面大小是窗口,看不匀是窗口带来的真正麻烦。

麻烦排序是反直觉的:桌子太小其实不可怕,因为它会报错,你立刻就知道要分批。可怕的是桌子刚好够大,纸全摊下了,它一句抱怨也没有——而中间那一摞,它只是扫了扫。

放到投资决策里意味着什么

把这两条规矩挪到财报上,会发生三件很具体的事。

第一件:一份年报到底装不装得下,是个会变的答案。 不同的工具、同一个工具的不同版本,桌面大小相差不是一点半点,而是量级上的差别——有的只能一次吃下一个章节,有的能把整份年报连附注一起吞掉。所以「年报能不能一次塞进去」这个问题没有通用答案,也不值得你去背某个数字(这类参数几乎每隔一阵就变一次)。你真正需要知道的只有一句:量级不同,用法就得不同。 桌面小的时候你必须自己动手切材料、自己决定喂哪一段;桌面大的时候你可以整份丢进去,但代价是你失去了「哪一段被看过」的控制权,得靠别的手段把它补回来。

手上这份材料到底占多大地方,倒是可以先估一估。站内的上下文与成本估算器按字数和中文占比折算,同样的字数中文换算出来比英文多两三倍,这一栏填错整个量级就错了。窗口上限那一栏得你自己去翻手上那个模型的官方说明填进去——页面不预置任何模型的数值,因为这类参数写死在页面上就是误导。

第二件,也是最坑的一件:装得下不等于读得匀。 位置带来的差别是实打实的——材料开头和结尾的内容,被准确引用的概率明显高于正中间那一段。这件事之所以特别适合坑投研的人,是因为财报里最值钱的信息,恰恰长在中段

想想一份年报的物理排布:前面是概览、主要财务指标、管理层讨论,后面是审计意见和一堆签字盖章的东西,而附注——关联交易、对外担保、未决诉讼、会计政策变更、应收账款的账龄结构——厚厚一摞压在中间。这些正是老手最想看的部分:应收账款就是货已经发出去、钱还没收回来的那笔;会计政策变更就是公司自己改了记账的规矩,同样的经营在账上可能就变了个样。你要找的疑点,八成藏在这类地方。

于是就形成了最糟糕的组合:你最想要的信息,正好落在它扫得最潦草的位置上。 你看到的却是一句语气平稳的「未见相关披露」。

第三件:你的聊天记录也在占桌面。 这是很多人从没意识到的。桌上摊的不只是你给的材料,还包括你之前问过的每一句话、它之前回答过的每一段话,全都占地方。你和它聊到第二十轮的时候,最开始那份材料,要么已经被挤下桌子了,要么被挤到了「中间」那个最容易被扫过去的位置。

这就解释了一个特别常见的体验:一段对话的前半程它挺听话,你说「所有数字都要标注原文位置」,它确实标了;聊着聊着它就开始不标了,你以为它变懒了,其实是你那句要求已经滑到桌子中间去了

想知道自己大概聊到第几轮会把桌子撑爆,把预计轮数和每轮问答的大致字数一并填进那个上下文与成本估算器就能看出来,顺带还能按你自己填的单价算笔账。

🚧 避坑

坑:把「它没报错」当成「它全读了」。 装不下的时候它会明说,扫得不仔细的时候它不会说。所以「顺利读完」这个信号只能证明第一条规矩没被触发,跟第二条规矩一点关系都没有。判断依据只能是你自己抽检的结果,不能是它的语气。

机制层:为什么中间那一段会塌,以及怎么自己测

为什么会有「中间塌陷」这回事

有两个可以讲得通的原因,你不需要记住术语,记住方向就行。

一是注意力被摊薄。这类模型在生成每个字的时候,都要回头把摊在桌上的所有内容过一遍,给不同的部分分配不同的权重。材料越长,每一小段能分到的权重就越薄。这就像一个人扫一整面墙的字,越长的墙,落在墙中央那几行的目光就越少。

二是它是这么被训练出来的。人类写东西有个根深蒂固的习惯:重要的话放开头(摘要、导语、要点),结论放结尾(总结、建议)。模型读了海量这样的文本,等于反复被训练成「开头和结尾更值钱」。这个倾向被带到了你的年报上——可惜年报不按这个规矩写,年报最值钱的东西在附注里。

这两条都是行为倾向的解释,不是保证。不同工具、不同版本上,塌陷的程度差别不小,甚至有些场景下几乎察觉不到。所以下一步不是让你去记结论,而是让你自己测一遍。

自己测:三次埋点

这个实验十分钟能做完,而且换一个工具就该重做一次。做法是往材料里埋一句只有你知道的话,然后看它捞不捞得出来。

准备:找一份你手上真实的长材料,比如一份年报或者一沓公告合集。往里面手动插入一句极其具体、原文绝不可能有的话,比如「本节校验编号为紫罗兰三七」。这句话必须满足两个条件:足够怪,绝不可能被它靠常识猜出来;足够短,不影响材料本身。

然后做三遍:

  • 第一遍,把这句话插在材料最前面几页之内,整份喂进去,问它「文中的校验编号是什么」。
  • 第二遍,换一份干净的原材料,把同一句话插在材料正中间,重新开一个对话,问同样的问题。
  • 第三遍,插在材料最后几页之内,再来一次。

每一遍都必须开新对话,否则上一轮的记录会占桌面,也会泄漏答案。

结果怎么读:三次全捞出来,说明这份材料的长度对这个工具还算轻松,你可以整份喂,但仍然要抽检。第一、三遍捞得出、第二遍捞不出,就是典型的中间塌陷,这时候你已经知道这份材料的中段对它等于不存在,必须改喂法。三次都捞不出,那多半是压根没吃进去——检查一下是不是超了硬边界,或者是不是被静默截断了。

进阶一点的玩法:埋三句不同的话,分别放在前、中、后,一次喂进去,让它把三个编号全报出来。这样一遍就能看出梯度。想把「怎么系统性地测一个工具适不适合做投研」做成一套固定动作,可以接着看 怎么自己测一个模型适不适合做投研,本节的埋点只是其中最基础的一项。

材料超量时的四个动作

测完你大概会得出一个结论:整份丢进去这件事,要么做不到,要么做得到但不可靠。那就改喂法。四个动作,按重要性排。

动作一:按问题取材料,别按材料提问题。 大多数人的顺序是反的——先把整份年报丢进去,再想问什么。正确的顺序是先定死你要回答的那个问题,比如「应收账款的账龄结构这一年有什么变化」,然后只把相关的那几页喂进去。材料从几百页缩到十几页,桌子够不够的问题当场消失,中间塌陷的问题也基本消失。定位这几页你自己用目录和搜索干,几十秒的事,而且这一步你干比它干靠谱得多。

动作二:一次一问。 一口气抛十个问题过去,它的回答会被平均摊薄,每个问题分到的深度都不够,而且你没法判断哪个答案是认真找过的、哪个是顺口编的。拆成十次问,每次只问一件事,答案质量的差别会大到你意外。

动作三:重要的东西放两端。 既然开头结尾更受重视,那就利用它。把最关键的那段原文放在整个输入的最后,紧挨着你的问题;把任务要求(比如「所有数字必须给出原文位置,找不到就明说找不到,不许推测」)在开头写一遍、结尾再写一遍。听起来像是在讨好机器,但它确实有效,成本也接近于零。

动作四:每一轮重述口径。 对抗聊天记录挤占桌面的唯一办法,就是把关键约束在每一轮里重复一次,或者干脆开个新对话重新喂材料。判断什么时候该重开的信号很朴素:当它开始不遵守你早先定下的规矩时,不要去责备它,去重开。

这四个动作是应急处理。材料动辄几百页、而且不止一份的时候,你需要的是一套固定的切分和汇总流程,那是 几百页的材料怎么喂给 AI 的正题,这里不展开。

还有一件常被忽略的事:输出也占桌面

桌面是共享的——你给的输入和它写的回答,占的是同一张桌子。让它「把这一章逐段复述一遍」,等于让它拿一大块桌面去堆一堆你本来就有的文字,纯属浪费。

所以对付长材料还有一条省地方的原则:要它给结构,别要它给散文。 让它输出一张表,每行是一个字段加一处原文位置,比让它写八百字的段落有用得多,也省得多。这一条在 让它吐表格,别让它写散文 里有更完整的展开。

⚠️ 风险提示

窗口够大、材料全塞进去了,也不能免掉回原文核对这一步。「没找到」是一种失败,「找到了但数字是编的」是另一种更隐蔽的失败,后者跟窗口大小基本无关。凡是要写进你自己记录的数字,一律回原文对一遍——为什么必须这么做,见 编造的财务数字长什么样 和概念库里的 AI 幻觉的形态与核验清单。本站所有内容只讲方法,不构成任何投资建议。

顺手澄清两个常见误解

误解一:窗口越大越好,所以我应该只挑窗口最大的用。 窗口是允许你放多少东西的上限,不是保证放进去的东西被读好的承诺。这就像卡车的载重上限——标得高只说明你能装,不说明装满之后货不会颠坏。选工具要看的是你自己测出来的埋点结果,不是宣传页上的数字。至于哪家的更好,这种排名下个月就过期,不值得记。

误解二:它说「文中未见相关披露」,那就是真没披露。 这句话有三种截然不同的成因:材料超了硬边界被截断、材料在桌上但那段落在中间被扫过去了、材料确实没写这件事。三种成因看起来一模一样,但你的下一步动作完全不同。判断办法很简单:把你怀疑的那一段单独摘出来,只喂这一段,再问一遍。 单独喂它答得出来,说明前面是位置问题不是内容问题;单独喂它还是答不出来,你才有理由怀疑原文真的没写——当然,最终还是得你自己翻一遍才算数。

这一步是投研里性价比最高的动作之一,因为它把「它没读到」和「原文没有」这两件事分开了。这两件事被混为一谈的时候,你会漏掉真正的风险点;分开之后,你就只剩下一个可以动手解决的问题。

小结

  • 上下文窗口就是它一次能同时看见多少字。硬边界会报错,你立刻知道;看不匀不会报错,这才是真正的坑
  • 装得下不等于读得匀:材料开头和结尾被准确引用的概率高于正中间,而年报里最值钱的附注偏偏压在中间。
  • 你的聊天记录也占桌面。聊得越久,最早给的材料和最早定的规矩越容易被挤到边缘——它开始不守规矩时,不是它变懒了,是该重开对话了。
  • 换一个工具就重做一次三次埋点:把一句绝不可能被猜到的怪话分别插在材料的前、中、后,每次开新对话去问,看它捞不捞得出来。
  • 超量时四个动作:按问题取材料(最有效)、一次一问、重要内容放两端、每轮重述口径。要表格不要散文,还能省出桌面。
  • 「文中未见相关披露」有三种成因,把那一段单独摘出来再问一遍,就能分清是它没读到还是原文真没写。

一句话总结:它一次只能把有限的纸摊在桌上,而且中间那一摞它扫得最快——所以别指望一股脑全塞给它,你自己挑出那几页递过去,反而快得多、也准得多。

内容有错、看不懂、或想看下一篇?告诉我们 →

本文为投资教育整理,不构成任何投资建议;不荐个股/基金、不预测点位、不承诺收益。关键数据与结论请结合权威来源自行验证,并见风险免责声明