让 AI 读评论区判断情绪,你能拿到什么,拿不到什么
- 说清一个情绪读数为什么不能直接当买卖依据的三条机制,并能当场判断一份「情绪分」有没有基准
- 把提问从「给我打个分」改成「按字段抽出来」,让它的错误变成你一眼能看见的错误
- 用一个三十条文本的小对照集,自己测出它在哪一类中文表达上会读反
你把某消费公司最近两周的新闻标题、公告摘要,加上几百条评论区留言,一股脑贴给 AI,让它判断一下市场情绪。它很配合地回了你一个数:情绪偏正面,0.72。
然后你就卡在这儿了。
0.72 是高还是低?比上周高还是低?如果它是 0.55,你会做什么不一样的事吗?——多数人到这一步会含糊过去,心里默默把它当成一个「好像还行」的印象,然后继续做原本就想做的决定。这个数字最危险的地方,不是它算错了,而是它看起来像一个能直接用的东西。
这一节不劝你别用,只把它卡住的三个地方拆开,再说清楚它在什么位置上是真好用的。
先说人话:小区门口那帮人的议论
你想知道楼下新开那家餐馆值不值得去,最省事的办法是听小区门口那几位大爷议论。听半小时,你确实能听出个大概。
但这里面有三件事,你不用学任何理论也知道:
议论热闹,不等于东西好。 有时候大家夸,是真好吃;有时候大家夸,是因为它开业送鸡蛋。热度和品质中间没有一条固定的换算关系。
等你听见的时候,队已经排上了。 大爷们能议论出来的,说明这事已经传开了。你到店门口,前面站了四十个人——那个「好」你确实听到了,但你拿不到了。
大爷说话你还得会听。 「那家服务是真好,我等了四十分钟。」字面上全是好词,意思正好相反。你听得出来是因为你熟悉这帮人的说话方式,一个刚搬来的外地人听不出来。
这三件事,原封不动就是 AI 做舆情分析卡住的三道坎。下面一道一道说,说的是它对你的决策到底意味着什么,以及为什么会这样。
第一道坎:情绪和价格的关系,本来就不是一条固定的线
对你意味着什么
意味着你没法建立「情绪正面就买、情绪转负就卖」这样一条规则,不是因为 AI 读得不够准,而是因为哪怕情绪读得完全准,这条规则本身也不成立。
这句话值得停一下。多数人潜意识里觉得,如果模型再强一点、读得再准一点,这事就通了。不通。你要先接受:情绪和后续价格之间那根线,本身就是软的、会变号的、随场合改口径的。读得再准,也是准确地测量了一个不稳定的东西。
为什么会这样
第一层,说好话的人不一定掏钱。 情绪要影响价格,中间必须经过「有人真的下了单」这一步。一个人在评论区打十行赞美,和他真的买入,是两件事;而真正推动价格的那部分资金,恰恰是最不在评论区说话的。你测到的是嘴,不是钱包。这中间的漏损有多大、什么时候大,没有稳定答案。
第二层,同一个情绪读数在不同强度下意味相反。 温和的正面议论,和铺天盖地的亢奋,性质完全不同。前者可能意味着一件好事正在被慢慢认识到;后者往往意味着该买的人基本都已经买完了——想买的都进场了,接下来买盘从哪来?所以情绪和后续走势的关系更像一条拱形的曲线,而不是一条向上的斜线。你要是按「分数越高越看好」去用,在最亢奋的那一段会正好用反。行为金融那一支专门研究这类「人的反应本身如何反过来影响价格」的现象,这里不展开,你只要记住关系不是单调的。
第三层,也是最实用的一层:一个绝对分数没有意义,只有相对自己的历史才有意义。 0.72 不能和任何东西比较——它不能和另一家公司的 0.72 比(不同公司的评论区语气基线天差地别,有的板块常年戾气重,有的常年吹捧),也不能和上个月你用另一种问法算出来的 0.72 比。唯一有一点意义的用法是:同一套语料来源、同一套提问方式、同一个时间窗口,算出一条按天排列的序列,然后看今天相对这条序列自己的常态偏了多少。
这里可以借一个量化工程上的对照。在开源量化平台 qlib 里,「要预测什么」是在配置文件里写死的一行公式,明确到「哪个时点的价格相对哪个时点的价格的变化率」;而衡量一个信号有没有用,它的评价代码是按交易日分组、每天各算一个数,返回的是一条时间序列,而不是一个总分。这两个设计合起来说的是同一件事:一个孤零零的数不构成信息,一个有明确定义、能排成时间线、能和自己的历史比的数才构成信息。
你手上那个 0.72,既没有明确定义(AI 内部按什么标准给的分,你不知道,它自己也说不清),也没有时间线。它离「可用」还差两个环节。想把情绪真的做成一个能进系统的东西,绕不开先把它定义成规范的特征和标签,这件事本身有多讲究,特征与标签 那篇说得更细。
顺带一提:同一批文本、同样的问法,隔一天再问,它给的分未必一样。这个不稳定性会直接毁掉你辛苦攒的那条序列,是另一件必须单独测的事,见 同一个问题问两遍,答案为什么不一样。
第二道坎:你读到的情绪,价格多半已经读过了
对你意味着什么
意味着你从公开渠道扒来的舆情,作为「预测下一步」的材料,价值已经被吃掉了一大半;它剩下的价值在别的地方——在解释、在比对、在发现异常,不在预测。
为什么会这样
那条新闻从发布到你看见,中间隔着的时间,价格已经用来动过了。信息越公开、越容易获取,被计入价格的速度就越快,这是 有效市场假说 那一支最朴素的部分——它不需要你相信市场永远正确,只需要你承认:一条所有人都能免费看到的消息,很难还留着没被交易过。
更狠的一层在后面。就算某个时点上,「情绪指标高的股票后续涨得多」这件事真的成立过,一旦它被写成公式、做成产品、被足够多的钱照着执行,这个规律赚的钱会被抹平——原本要慢慢兑现的那部分,被压缩成了消息出现当天的一次性跳动,第二天才进场的人接的是已经计入好消息的价格。这条机制不是舆情独有的,它对所有公开可复现的规律都成立,信号衰减 那篇把整个生命周期拆开讲了。
情绪类数据在这条路上跑得尤其快,因为它的原料是公开文本,复现成本几乎为零:同样的社交平台、同样的新闻源、同样的现成模型,任何人都能算出一条高度雷同的曲线。大家算出来的东西越像,进场出场的时点就越像,收益越薄,而且拥挤时的回撤更深——出门的时候都挤在一个门口。
那还能怎么用
方向得换。把它从「预测器」降级成两样东西:
一是解释器。 价格已经动了,你想知道大家在议论什么。这个用途没有前面那些问题,因为你要的本来就是「已经发生的事」,而 AI 读大量文本、快速归纳出议题分布,正是它最扎实的能力。
二是变化探测器。 不看情绪的绝对水平,看有没有出现以前没出现过的东西:一类新的抱怨、一个新的产品名、一种以前没人提的担心。「今天有 300 条正面留言」几乎没有信息量;「今天开始出现一类以前一条都没有的投诉,讲的是同一个批次的质量问题」——这才是值得你放下手头的事去查证的信号。
还有一类值得留意的形态是背离:议论明显转坏但价格纹丝不动,或者反过来。背离本身不是买卖依据,它是一个提问句——「有一边是错的,我要不要花两小时搞清楚是哪一边」。把它当问题清单用,别当答案用。
诚实的补充:变化探测和背离,同样会随着更多人这么做而变薄,只是比「情绪高低」慢一点。没有哪条公开可复现的路能长期免疫这件事,你只能选一条衰减慢的、并且知道自己在跟时间赛跑。
第三道坎:中文的阴阳怪气,它经常读反
这一道坎最具体,也最容易被忽略,因为它出错的时候不报错。
对你意味着什么
意味着你的情绪序列会在最关键的时刻系统性地偏乐观。
为什么是「系统性」?因为反讽和黑话不是均匀分布的。事情顺的时候大家好好说话;事情糟的时候,反讽、自嘲、谐音、暗语的密度会陡然上升——「恭喜发财」「感谢公司回馈」「今天又是加仓的好日子」,字面上一水儿的好词。于是你的曲线在坏消息集中的那几天反而抬头。
误差如果是随机的,多测几次就摊平了;误差如果在你最需要它准的时候集中出现,那它比没有还糟——因为它给了你一个反向的安慰。 这是这一道坎真正的危险所在,不是「准确率低几个点」这么温和。
为什么会读反
反讽的字面情绪和真实情绪相反。 判断一句话的情绪,主要的依据仍然是词面和常见搭配;反讽恰恰是刻意让词面和意思对着干,而且它靠的是共同背景(大家都知道这家公司刚出了什么事),这个背景不在那句话里。
圈内黑话是约定俗成的,而且每年在变。 上车、站岗、吃面、割肉、大肉、抬轿——这些词在日常语料里另有含义,在这个语境下是另一套意思,而且新词一直在长出来。一个训练完成于某个时点的模型,对最近半年新冒出来的说法基本是懵的。它不会说自己不懂,它会按字面给你一个分。
规避审查产生的变形。 谐音、拆字、缩写、故意的错别字、表情符号代替关键词。人眼一扫就懂,按字面读就全乱了。
正式文本的委婉语是反着来的。 公告和财报里的负面表达高度收敛:「业绩承压」「持续投入导致费用阶段性上升」「审慎乐观」「同比减亏」。这些句子里几乎没有强负面词,字面读容易读成中性甚至正面,可它们在行业里的实际含义相当明确。同一套情绪判断,用在评论区和用在公告上,需要的是两把完全不同的尺子。
主体错配。 一段话里出现三家公司,情绪该记在谁头上?「某消费公司的主要对手翻车了」——这条对被讨论的公司是好是坏,取决于谁在被评价,而一段混合文本里的情绪归属,是最容易被算糊的部分之一。
怎么办:不修模型,改任务
你改不了它读不懂反讽这件事。但你能改的是你让它交什么东西。
把「给我打个情绪分」换成「按字段把内容抽出来」。同一批文本,让它逐条输出这样几列:
- 原句摘录(必须是原文,不许改写)
- 这句话在评价谁(明确的主体名,说不清就填「不确定」)
- 讲的是哪一类事(产品、渠道、管理层、股价本身、无关闲聊)
- 你判断它是正面还是负面,以及支撑这个判断的那几个字
- 是否疑似反讽或圈内暗语(是就单列出来,交给我看)
这一改,性质完全变了。打分是一个你无法验证的结论,抽取是一个你扫一眼就能查的动作。 原句在旁边摆着,你抽查十条,它有没有把「感谢公司回馈」读成正面,一目了然。而如果它只给你 0.72,同样的错误你永远发现不了。
这背后是一条更通用的原则:只把「错了你当场能看出来」的活交给它。 摘录错了、主体标错了,你一眼看得见;一个综合分算错了,你看不见,还会拿去做决定。让它吐结构化的表格而不是一段流畅的散文,具体怎么定字段、怎么处理它不肯守格式的情况,让它吐表格,别让它写散文 那篇是专门讲这个的。
顺便说个工程上的旁证。开源的 AI 投研智能体项目 Vibe-Trading 里有一条约束是结构性的、不是建议性的:最终结论里的数字主张,不允许和工具取回的原始数据相矛盾。做这套系统的人,默认模型会说出听起来很对但对不上原始材料的东西,所以在外面加了一道硬墙。你在聊天窗口里拿到的那个情绪分,没有经过任何这样的校验。
坑:让它一步到位给出「综合情绪指数」。 一步到位意味着中间所有的读错、归属错、口径变化都被压进了一个数里,压完就再也拆不开了。怎么避:拆成两步——第一步只让它抽取和标注,产出带原句的表;第二步的汇总你自己做(哪怕就是数一下正负条数),或者用一条你自己写死的规则去算。汇总这一步交给它,你就等于把唯一能验证的环节送走了。
它真正好用的位置:分诊台,不是裁判
泼完冷水得把话说完整。前面否掉的是「用它的判断替你做判断」,没有否掉它在整条流程里的价值——而且这个价值不小。
从一堆里挑出值得你亲自读的那几条。 五百条评论你读不完,让它按主题归类、把重复的合并、把明显的水贴滤掉,剩下二十条你自己读。这是纯粹的降维,而且错了你能发现——因为你终究要读原文。它在这个位置上省下的时间是实打实的。
盯住「新出现的东西」。 让它对比这周和上周的议题清单,只回答一个问题:哪些说法是这周才出现的。这个任务它做得又快又稳,因为它本质上是文本比对,不是价值判断。
当一个不嫌烦的反方。 你已经有了一个看法,把材料给它,让它专门找和你看法相反的证据,并且每条都要附原句。它读得多,很可能提到几个你没想过的角度。它产出的是问题清单,不是答案——而一份好的问题清单本身就值钱。
做翻译和定位。 公告里那句「计提减值准备」到底在说什么、财报里应收账款那段的原文在第几页,这类活它做得又快又好,你再自己回原文核对一遍。
看出规律了吗:它擅长的全是「处理已经摆在那里的文字」,不擅长的是「从这些文字里生成一个关于未来的结论」。 评论区的字已经存在了,明天的价格还不存在。这条线就是你使用它的边界线。
市面上有一类以「AI 情绪监控」「大数据舆情选股」为卖点的收费服务。按本节的三道坎去问它三个问题就够了:你的情绪分相对什么基准?你怎么处理中文反讽和圈内暗语,能不能给我看带原句的抽样?这条规律被这么多人用了之后,你怎么监测它有没有变薄?三个问题答不上来的,你买的是一个包装。任何以提供买卖点、暗示收益为卖点的服务,前面加不加 AI 两个字都不改变它的性质。 本站内容只讲原理和方法,不构成任何投资建议,完整边界见 免责声明。
自己测一遍:二十分钟,三十条
不要相信任何人(包括这篇)关于「它到底能不能读懂中文」的笼统结论,也不要去比较哪个模型更强——那种排名下个月就过期了。你要测的只有一件事:在你自己每天要读的那类文本上,它够不够用。
动作很具体:
一,攒三十条。 从你熟悉的那个板块里,手工挑三十条真实文本。别挑典型的,故意挑难的:十条评论区的(务必包含三四条明显的反讽和黑话)、十条新闻标题、十条公告或财报里的原句(挑那种委婉表达的)。
二,你自己先标。 每条标一个:正面、负面、中性、看不出。「看不出」这一档必须保留——它是后面最有信息量的一档。标完扣起来别看。
三,让它标。 用上面那套抽取式的字段,一条一条出。
四,只看错的那些,然后分类。 关键不是数对了几条,是看错在哪一类上:反讽读反了几条?黑话读成字面了几条?公告体的委婉语被读成中性或正面了几条?主体归错了几条?这份错误分布,才是你真正需要的结论——它告诉你哪一类文本可以放心交给它,哪一类必须你自己过一遍。
五,隔一天,同样三十条再跑一遍。 比对两次结果。如果它自己跟自己都对不上超过一小撮,那么用它拉出来的任何时间序列都是不可信的,因为序列上的波动分不清是市场变了还是它今天心情不同。
六,把这套东西存起来。 换了模型、换了提问方式、过了几个月,拿同一份三十条重跑,你就有了一把稳定的尺子。这三十条比任何评测榜单都更有用,因为它测的是你的活儿。
这套自测的完整方法论——包括怎么设计对照集、怎么避免自己在标注的时候被答案影响、怎么判断样本量够不够——在 怎么自己测一个模型适不适合做投研 里展开。
小结
- 一个孤零零的情绪分没有信息量。要有意义,必须是:同一套语料来源、同一套问法、排成一条按天的序列,然后和它自己的历史比。
- 就算情绪读得完全准,「情绪好就买」这条规则也不成立:说好话的人不一定掏钱;温和的正面和极端的亢奋含义相反,关系是拱形的不是斜线。
- 公开渠道的舆情,作为预测材料价值已被吃掉大半——公开信息计入价格快,且这类数据复现成本几乎为零,谁都能算出雷同的曲线。剩下的价值在解释、在探测新出现的议题、在看情绪与价格的背离。
- 中文的反讽、圈内黑话、谐音变形、公告体委婉语、主体错配,会让它读反;而这类表达在坏消息时密度最高,误差集中出现在你最需要它准的时候。
- 破法不是修模型,是改任务:把「打分」换成「带原句的结构化抽取」,让它的错误变成你扫一眼就能发现的错误。汇总那一步自己做。
- 它真正扎实的位置是分诊台:从几百条里挑出值得你亲自读的、盯住这周新出现的说法、当一个附原句的反方、做翻译和定位。判断权留在你手里。
- 不要问哪个模型强,要用你自己那三十条难例去测,重点看错误的分布而不是总数,并隔天重跑看它稳不稳。
一句话总结:它能帮你把该看的东西挑出来,但看完之后是好是坏,还得你自己下判断——门口大爷说什么你可以听,可掏钱的是你。
本文涉及的开源项目内容来自上述源码快照,是阅读代码与文档得出的机制说明,不是运行结果;具体行为请以你手上那个版本为准。回 量化与 AI 投研概念库 看相关概念各自在说什么。
本文为投资教育整理,关键数据与结论请结合下列权威来源验证。