窗口大小与单价这里一个都不预设:这两类数字变得最快,写死在页面上就是误导。 请翻你手上那个模型的官方说明,把窗口上限和你实际付的价目填进来,币种以你填的为准, 工具只做算术,不判断哪个模型更值。
每一轮实际送进去多少:多轮累计消耗
每根柱是那一轮上下文里躺着的 token 量。最底下那段材料每轮都要重发一次, 中间那段是被重发的历史问答——它一轮比一轮厚,这就是多轮对话越聊越贵的全部原因。
- 重发的材料
- 重发的历史
- 本轮提问
- 本轮回复
为什么比你估的贵
如果按「材料只喂一次、后面几轮就是几句问答」来估,10 轮总共约 6.14 万 token; 而按每轮都要把材料和历史重发一遍来算,实际约 59.05 万 token,是前者的 9.61 倍。 差距来自一个容易忽略的事实:对话本身没有记忆,「它还记得刚才那句」的实现方式, 就是把刚才那句连同材料一起再发一次。轮数越多,这份重复的量涨得越快。
装不下时的三条路(都有代价)
没有哪条是免费的。选之前先想清楚你的问题需不需要通篇对照——这一条基本能决定选哪个。
分块喂:切成几段分别问
窗口没填,或窗口连一问一答都放不下,无法估算块数
代价:费用大致按块数翻倍,而且跨块的对比会断
每一块都要单独付一次输入费,块数就是倍数。更麻烦的是跨块推理:分块之后,模型看不到「第一块的数字」和「第八块的数字」放在一起是什么关系,凡是需要前后对照的问题都会答得含糊。适合「每块内部自成一段」的材料,不适合需要通篇比对的场景。
先摘要:压缩后再问
需要先填材料字数才能估算压缩前后的量
代价:先付一次全文的钱,且摘要丢掉的细节之后再也找不回来
压缩这一步本身要把全文过一遍,该付的输入费一分不少,省的是后面的每一轮。真正的代价在信息损失:摘要必然按某种偏好取舍,被丢掉的往往正是你后面想追问的细枝末节;如果摘要环节把数字概括错了,后续所有结论都建在错的底座上,而你从对话里看不出来。用这条路时,关键数字最好回原文再核一遍。
检索:只喂相关片段
需要先填窗口大小才能判断片段要压到多小
代价:单轮最省,但取错片段就答错,而且要额外搭切分与检索这套环节
这 是长期最省钱的做法,代价挪到了工程上:材料要先切分、建索引,每次提问先检索再拼上下文。风险也随之换了位置——不再是「装不下」,而是「该取的那段没取到」。检索漏了的内容,模型不会告诉你它没看到,只会照着手上有的那点材料自信作答。所以这条路必须配一步人工抽查:随机挑几个结论,回原文确认引用的是不是对的段落。
可选:粘一段材料,自动数字数
粘进来的文字只在你自己的浏览器里统计,不会上传到任何地方。 工具只数字符、分中英文,不读内容、不做任何分析。
风险提示
- token 数是按字符经验系数估算的量级参考,不是精确值。真实切分由各家模型自己的分词器决定,不同模型之间差三四成很常见,请以你实际调用后拿到的用量为准。
- 页面不预设也不比较任何模型的窗口大小与价格。窗口与单价请按你手上那个模型的官方说明填,这两类数字变动频繁,站内不做记录。
- 费用估算只覆盖对话本身的输入与输出,不含任何附加计费项。多轮口径按每轮重发全部历史计算,实际用量取决于你所用工具是否做了裁剪或缓存。
- 把材料喂进模型能加快阅读,但模型的 输出可能出错、可能编造,凡是要用于决策的数字都必须回一手资料核对。本工具不判断任何标的,不发出买卖信号,也不承诺任何收益。
教育演示:token 数 = 中文字符 × 中文系数 + 拉丁字符 × 拉丁系数; N 轮累计输入 = N × 材料 + 每轮提问 + 逐轮累加的历史。 本工具仅为测算演示,不构成投资建议。
怎么用
6 步- 填材料字数,或直接粘一段进来:知道字数就直接填,支持「8万」这样的写法。不知道就把材料粘到页面最下面那个框里,工具会数出非空白字符数与中文占比,点「填入上方」自动回填。粘贴的文字只在你自己的浏览器里统计,不会上传。
- 填中文占比:纯中文材料填 100,中英混排按大致比例填。这一栏不是凑数的:同样字数下中文折算出来的 token 比英文多两三倍,占比填错,后面所有数字都会跟着错一个量级。
- 填上下文窗口大小:翻你手上那个模型的官方说明,把窗口上限填进来,写「128k」也认。页面不预置任何模型的窗口数值——那是全站最典型的易变数字,写死在页面上等于误导。填了之后才会判断装不装得下。
- 填轮数与每轮的问答长度:预计要来回聊几轮、你每次追问大概多少字、它每次回复大概多少字。这三个数决定了历史长得多快,也决定了第几轮会把窗口撑爆。
- 想算钱就把单价填上:输入单价和输出单价按你实际付的价目填,右边选清楚是按每千 token 还是每百万 token 计。留空也能用,只是不显示费用。工具不知道你填的是哪种货币,也不比较哪家更便宜。
- 看柱状图,别只看第一轮:每根柱是那一轮上下文里躺着的量。最底下那段材料每轮都要重发一次,中间那段历史一轮比一轮厚。真正让人预算翻车的从来不是第一轮,是第十轮。
两个问题:喂得进去吗,花多少钱
把一份年报、一沓研报或者一段调研纪要交给模型帮你读,动手之前只有两个问题需要先有个数: 这份材料能不能一次装进它的上下文窗口,以及来回问上十几轮之后大概要花多少钱。 这两个问题都不需要精确答案,需要的是量级——是差一点还是差一个数量级, 是几块钱还是几百块,量级对了,接下来怎么安排就清楚了。
本工具只做这件事。它不接任何模型接口,不上传你粘进去的任何文字, 也不预置任何模型的窗口大小和价格。后面这一条是刻意的:窗口和价目是变动最频繁的一类数字, 今天写在页面上,下个月就成了错的,而读者未必会去核对。所以这两栏一律空着, 请你翻手上那个模型的官方说明填进来。工具只负责算术。
字数怎么变成 token
模型读文本前会先把它切成一段一段的词块,这些块才是它真正吃进去的单位,也是计费的单位。 切法既不是按字也不是按词,而是按训练时统计出来的常见片段来切, 于是「一个 token 等于几个字」没有固定答案,只有区间。 本工具按中文与拉丁两档分别折算,再给出一个上下沿: 一个汉字大致相当于零点五到一个多,一个拉丁字符只有零点二几。
两档分开算,是因为差距实在太大。同样一万个字符,纯中文可能是七八千,纯英文可能只有两三千。 这带来一个和直觉相反的结论:中文密集的访谈记录和财报附注,字数看着不吓人, 喂进去却相当占地方;夹杂大量代码、表格和英文原文的材料反而没那么吃窗口。 所以「中文占比」那一栏不是凑数的,填错会让整页的数字错一个量级。
也正因为切分由各家自己的分词器决定,页面给的是区间而不是单一数值。 判断装不装得下的时候,请看上沿而不是中间那个数——按中间值刚好塞得下的材料, 实际调用时被截掉一截是很常见的事。
多轮对话的账,是按平方涨的
最容易把预算算低的地方在这里。对话本身没有记忆, 看起来它记得你上一句,实际的做法是每问一次就把材料和之前全部问答重新发一遍。 于是第一轮是材料加一个问题,第二轮多背上一问一答,第三轮再多一组,越往后越沉。 聊 N 轮,材料要整整付 N 次,历史的累计量按等差数列增长,总量和轮数的平方成正比。
页面上那个倍数就是这么来的:多数人心里估的是「材料付一次,后面几轮就是几句问答」, 实际往往是这个天真口径的好几倍,而且轮数越多,倍数越大。 柱状图画的正是这件事——最底下那段材料每根柱上都有,中间那段历史一轮比一轮厚。 看图时别只看第一根,让预算翻车的从来是第十根。
顺着这个结构,有三条能立刻用上的做法。长材料尽量一次把问题问清楚, 别用聊天的方式挤牙膏;聊偏了就开新会话,在旧会话里继续绕,等于每一轮都在为一堆无关历史付费; 如果你用的工具会自动裁剪或缓存历史,实际用量会低于这里的估算, 具体低多少要看那个工具怎么实现,本页按最保守的口径算。
装得下不等于用得好
超出窗口的后果很直接:要么报错,要么被悄悄截掉一段而你收不到任何提示。 但更该留意的是没超窗口时的另一种损耗——塞得越满,中间那一段的利用率越低。 大量实际使用中都能观察到同一个现象:开头和结尾的内容抓得比较牢, 夹在中间的内容注意力明显下降,材料越长这个凹陷越明显。
这意味着把超长材料整个塞进去、再问一个需要在中段找证据的问题,答偏的概率会上升, 而它的回答通常照样流畅笃定,你很难从语气上看出它其实没看到那一段。 所以即便装得下,也优先只喂与问题相关的那部分; 一定要喂全文时,把最关键的材料放在开头或结尾,并且要求它对关键结论给出引用的原文片段, 你再回原文核一遍。
装不下时的三条路,各有各的代价
选之前先问自己一句:我要问的这件事,需不需要把材料前后两头放在一起对照。 不需要通篇对照的,分块最省事,切成几段分别问,费用大致按块数翻倍, 代价是跨块推理会断,模型看不见第一块和第八块之间的关系。
需要通篇对照、又能接受损失细节的,可以先摘要。 要留意压缩这一步本身得把全文过一遍,该付的输入费一分不少,省的是后面每一轮。 真正的代价在信息损失:摘要必然按某种偏好取舍,丢掉的往往正是你后面想追问的细节; 要是摘要环节把数字概括错了,后续所有结论都建在错的底座上,而你从对话里看不出来。
同一份材料要反复查很多次的,值得搭检索:每轮只送进相关片段,长期最省, 代价是要做切分和索引,而且风险换了位置——检索漏掉的内容, 模型不会告诉你它没看到,只会拿手上那点材料自信作答。 所以这条路必须配一步人工抽查:随机挑几个结论,回原文确认引用的是不是对的段落。
边界与本工具的假设
本工具假设每轮都完整重发材料与历史、每轮问答长度大致稳定、材料只按中文与拉丁两档折算。 真实调用里这三条都可能不成立:有的工具会裁剪或缓存历史, 问答长度往往忽长忽短,表格与代码的切分效率也和普通行文不同。 所以这里给的是量级,不是账单。要卡预算,请先小规模跑一次看实际用量回执,再按比例外推。
风险提示:token 折算系数为经验区间,实际切分由各模型自己的分词器决定,请以实际用量为准。 页面不预置也不比较任何模型的窗口与价格。模型输出可能出错、可能编造, 凡用于决策的数字都必须回一手资料核对。本工具仅为测算演示,不判断任何标的, 不发出买卖信号,不构成投资建议,也不承诺任何收益。
常见问题
6 条token 到底是什么?为什么不直接按字数收费?
同样的字数,中文为什么比英文更费 token?
这个估算的误差有多大?能当准数用吗?
为什么多轮对话比我以为的贵得多?
上下文塞满了会怎样?是不是只要不超就没事?
装不下的时候,分块、摘要、检索这三条路怎么选?
本工具仅为测算演示,不构成投资建议。计算结果受输入假设影响,实际情况请以官方规定与金融机构公布为准。