投资理财

上下文与成本估算器

按字数估算一份材料折合多少 token、能不能一次喂进去、以及按你自己填的单价大致要花多少钱。

  • 免费免注册
  • 结果可分享链接
  • 浏览器本地计算

窗口大小与单价这里一个都不预设:这两类数字变得最快,写死在页面上就是误导。 请翻你手上那个模型的官方说明,把窗口上限和你实际付的价目填进来,币种以你填的为准, 工具只做算术,不判断哪个模型更值。

5.62 万
材料估算 token
区间 4.12 万 ~ 7.85 万
材料占窗口
填上窗口大小才能判断
59.05 万
10 轮累计 token
输入 58.63 万 + 输出 4,210
10 轮估算费用
填了单价才有费用
按中位口径估算约 56,160 token(区间 41,200 ~ 78,480)。填上你手上那个模型的窗口大小,才能判断装不装得下。

每一轮实际送进去多少:多轮累计消耗

每根柱是那一轮上下文里躺着的 token 量。最底下那段材料每轮都要重发一次, 中间那段是被重发的历史问答——它一轮比一轮厚,这就是多轮对话越聊越贵的全部原因。

第 1 轮纵轴上限约 6.14 万 token第 10 轮
  • 重发的材料
  • 重发的历史
  • 本轮提问
  • 本轮回复

为什么比你估的贵

如果按「材料只喂一次、后面几轮就是几句问答」来估,10 轮总共约 6.14 万 token; 而按每轮都要把材料和历史重发一遍来算,实际约 59.05 万 token,是前者的 9.61 倍。 差距来自一个容易忽略的事实:对话本身没有记忆,「它还记得刚才那句」的实现方式, 就是把刚才那句连同材料一起再发一次。轮数越多,这份重复的量涨得越快。

装不下时的三条路(都有代价)

没有哪条是免费的。选之前先想清楚你的问题需不需要通篇对照——这一条基本能决定选哪个。

分块喂:切成几段分别问

窗口没填,或窗口连一问一答都放不下,无法估算块数

代价:费用大致按块数翻倍,而且跨块的对比会断

每一块都要单独付一次输入费,块数就是倍数。更麻烦的是跨块推理:分块之后,模型看不到「第一块的数字」和「第八块的数字」放在一起是什么关系,凡是需要前后对照的问题都会答得含糊。适合「每块内部自成一段」的材料,不适合需要通篇比对的场景。

先摘要:压缩后再问

需要先填材料字数才能估算压缩前后的量

代价:先付一次全文的钱,且摘要丢掉的细节之后再也找不回来

压缩这一步本身要把全文过一遍,该付的输入费一分不少,省的是后面的每一轮。真正的代价在信息损失:摘要必然按某种偏好取舍,被丢掉的往往正是你后面想追问的细枝末节;如果摘要环节把数字概括错了,后续所有结论都建在错的底座上,而你从对话里看不出来。用这条路时,关键数字最好回原文再核一遍。

检索:只喂相关片段

需要先填窗口大小才能判断片段要压到多小

代价:单轮最省,但取错片段就答错,而且要额外搭切分与检索这套环节

这是长期最省钱的做法,代价挪到了工程上:材料要先切分、建索引,每次提问先检索再拼上下文。风险也随之换了位置——不再是「装不下」,而是「该取的那段没取到」。检索漏了的内容,模型不会告诉你它没看到,只会照着手上有的那点材料自信作答。所以这条路必须配一步人工抽查:随机挑几个结论,回原文确认引用的是不是对的段落。

可选:粘一段材料,自动数字数

粘进来的文字只在你自己的浏览器里统计,不会上传到任何地方。 工具只数字符、分中英文,不读内容、不做任何分析。

风险提示

  • token 数是按字符经验系数估算的量级参考,不是精确值。真实切分由各家模型自己的分词器决定,不同模型之间差三四成很常见,请以你实际调用后拿到的用量为准。
  • 页面不预设也不比较任何模型的窗口大小与价格。窗口与单价请按你手上那个模型的官方说明填,这两类数字变动频繁,站内不做记录。
  • 费用估算只覆盖对话本身的输入与输出,不含任何附加计费项。多轮口径按每轮重发全部历史计算,实际用量取决于你所用工具是否做了裁剪或缓存。
  • 把材料喂进模型能加快阅读,但模型的输出可能出错、可能编造,凡是要用于决策的数字都必须回一手资料核对。本工具不判断任何标的,不发出买卖信号,也不承诺任何收益。

教育演示:token 数 = 中文字符 × 中文系数 + 拉丁字符 × 拉丁系数; N 轮累计输入 = N × 材料 + 每轮提问 + 逐轮累加的历史。 本工具仅为测算演示,不构成投资建议。

链接带当前参数,发给别人打开就是同一份结果。

怎么用

6 步
  1. 填材料字数,或直接粘一段进来:知道字数就直接填,支持「8万」这样的写法。不知道就把材料粘到页面最下面那个框里,工具会数出非空白字符数与中文占比,点「填入上方」自动回填。粘贴的文字只在你自己的浏览器里统计,不会上传。
  2. 填中文占比:纯中文材料填 100,中英混排按大致比例填。这一栏不是凑数的:同样字数下中文折算出来的 token 比英文多两三倍,占比填错,后面所有数字都会跟着错一个量级。
  3. 填上下文窗口大小:翻你手上那个模型的官方说明,把窗口上限填进来,写「128k」也认。页面不预置任何模型的窗口数值——那是全站最典型的易变数字,写死在页面上等于误导。填了之后才会判断装不装得下。
  4. 填轮数与每轮的问答长度:预计要来回聊几轮、你每次追问大概多少字、它每次回复大概多少字。这三个数决定了历史长得多快,也决定了第几轮会把窗口撑爆。
  5. 想算钱就把单价填上:输入单价和输出单价按你实际付的价目填,右边选清楚是按每千 token 还是每百万 token 计。留空也能用,只是不显示费用。工具不知道你填的是哪种货币,也不比较哪家更便宜。
  6. 看柱状图,别只看第一轮:每根柱是那一轮上下文里躺着的量。最底下那段材料每轮都要重发一次,中间那段历史一轮比一轮厚。真正让人预算翻车的从来不是第一轮,是第十轮。
深入讲解

两个问题:喂得进去吗,花多少钱

把一份年报、一沓研报或者一段调研纪要交给模型帮你读,动手之前只有两个问题需要先有个数: 这份材料能不能一次装进它的上下文窗口,以及来回问上十几轮之后大概要花多少钱。 这两个问题都不需要精确答案,需要的是量级——是差一点还是差一个数量级, 是几块钱还是几百块,量级对了,接下来怎么安排就清楚了。

本工具只做这件事。它不接任何模型接口,不上传你粘进去的任何文字, 也不预置任何模型的窗口大小和价格。后面这一条是刻意的:窗口和价目是变动最频繁的一类数字, 今天写在页面上,下个月就成了错的,而读者未必会去核对。所以这两栏一律空着, 请你翻手上那个模型的官方说明填进来。工具只负责算术。

字数怎么变成 token

模型读文本前会先把它切成一段一段的词块,这些块才是它真正吃进去的单位,也是计费的单位。 切法既不是按字也不是按词,而是按训练时统计出来的常见片段来切, 于是「一个 token 等于几个字」没有固定答案,只有区间。 本工具按中文与拉丁两档分别折算,再给出一个上下沿: 一个汉字大致相当于零点五到一个多,一个拉丁字符只有零点二几。

两档分开算,是因为差距实在太大。同样一万个字符,纯中文可能是七八千,纯英文可能只有两三千。 这带来一个和直觉相反的结论:中文密集的访谈记录和财报附注,字数看着不吓人, 喂进去却相当占地方;夹杂大量代码、表格和英文原文的材料反而没那么吃窗口。 所以「中文占比」那一栏不是凑数的,填错会让整页的数字错一个量级。

也正因为切分由各家自己的分词器决定,页面给的是区间而不是单一数值。 判断装不装得下的时候,请看上沿而不是中间那个数——按中间值刚好塞得下的材料, 实际调用时被截掉一截是很常见的事。

多轮对话的账,是按平方涨的

最容易把预算算低的地方在这里。对话本身没有记忆, 看起来它记得你上一句,实际的做法是每问一次就把材料和之前全部问答重新发一遍。 于是第一轮是材料加一个问题,第二轮多背上一问一答,第三轮再多一组,越往后越沉。 聊 N 轮,材料要整整付 N 次,历史的累计量按等差数列增长,总量和轮数的平方成正比。

页面上那个倍数就是这么来的:多数人心里估的是「材料付一次,后面几轮就是几句问答」, 实际往往是这个天真口径的好几倍,而且轮数越多,倍数越大。 柱状图画的正是这件事——最底下那段材料每根柱上都有,中间那段历史一轮比一轮厚。 看图时别只看第一根,让预算翻车的从来是第十根。

顺着这个结构,有三条能立刻用上的做法。长材料尽量一次把问题问清楚, 别用聊天的方式挤牙膏;聊偏了就开新会话,在旧会话里继续绕,等于每一轮都在为一堆无关历史付费; 如果你用的工具会自动裁剪或缓存历史,实际用量会低于这里的估算, 具体低多少要看那个工具怎么实现,本页按最保守的口径算。

装得下不等于用得好

超出窗口的后果很直接:要么报错,要么被悄悄截掉一段而你收不到任何提示。 但更该留意的是没超窗口时的另一种损耗——塞得越满,中间那一段的利用率越低。 大量实际使用中都能观察到同一个现象:开头和结尾的内容抓得比较牢, 夹在中间的内容注意力明显下降,材料越长这个凹陷越明显。

这意味着把超长材料整个塞进去、再问一个需要在中段找证据的问题,答偏的概率会上升, 而它的回答通常照样流畅笃定,你很难从语气上看出它其实没看到那一段。 所以即便装得下,也优先只喂与问题相关的那部分; 一定要喂全文时,把最关键的材料放在开头或结尾,并且要求它对关键结论给出引用的原文片段, 你再回原文核一遍。

装不下时的三条路,各有各的代价

选之前先问自己一句:我要问的这件事,需不需要把材料前后两头放在一起对照。 不需要通篇对照的,分块最省事,切成几段分别问,费用大致按块数翻倍, 代价是跨块推理会断,模型看不见第一块和第八块之间的关系。

需要通篇对照、又能接受损失细节的,可以先摘要。 要留意压缩这一步本身得把全文过一遍,该付的输入费一分不少,省的是后面每一轮。 真正的代价在信息损失:摘要必然按某种偏好取舍,丢掉的往往正是你后面想追问的细节; 要是摘要环节把数字概括错了,后续所有结论都建在错的底座上,而你从对话里看不出来。

同一份材料要反复查很多次的,值得搭检索:每轮只送进相关片段,长期最省, 代价是要做切分和索引,而且风险换了位置——检索漏掉的内容, 模型不会告诉你它没看到,只会拿手上那点材料自信作答。 所以这条路必须配一步人工抽查:随机挑几个结论,回原文确认引用的是不是对的段落。

边界与本工具的假设

本工具假设每轮都完整重发材料与历史、每轮问答长度大致稳定、材料只按中文与拉丁两档折算。 真实调用里这三条都可能不成立:有的工具会裁剪或缓存历史, 问答长度往往忽长忽短,表格与代码的切分效率也和普通行文不同。 所以这里给的是量级,不是账单。要卡预算,请先小规模跑一次看实际用量回执,再按比例外推。

风险提示:token 折算系数为经验区间,实际切分由各模型自己的分词器决定,请以实际用量为准。 页面不预置也不比较任何模型的窗口与价格。模型输出可能出错、可能编造, 凡用于决策的数字都必须回一手资料核对。本工具仅为测算演示,不判断任何标的, 不发出买卖信号,不构成投资建议,也不承诺任何收益。

常见问题

6 条
token 到底是什么?为什么不直接按字数收费?
用大白话说,token 是模型读文本时的最小单位,可以理解成「切碎之后的词块」。模型看不懂原始的字符流,得先用一个叫分词器的东西把文本切成一段一段,每一段编成一个编号,这些编号才是模型真正吃进去的东西。切法不是按字、也不是按词,而是按训练时统计出来的常见片段来切:英文里 the、ing 这种高频组合会被切成一个整块,生僻的长单词会被拆成好几块;中文里常见的双字词可能合成一块,冷僻字则可能单独占一块甚至更多。所以「一个 token 等于几个字」没有固定答案,只有大致的区间。不按字数收费,是因为计费必须对齐模型实际处理的工作量,而工作量是按 token 计的——一段全是生僻字的文本和一段全是常用词的文本,字数一样,切出来的 token 数可能差不少。你在这个页面上看到的所有数字都是从字数反推的估算,真正的 token 数要等调用完拿到用量回执才知道。
同样的字数,中文为什么比英文更费 token?
这跟分词器的训练语料和切分粒度有关。多数通用模型的分词器以英文语料为主训练,英文的常见词根、后缀被合并成了很多现成的整块,平均下来大约每四个字符才占一个 token,也就是说一个七八个字母的英文单词往往只算一到两个 token。中文没有空格分词,一个汉字承载的信息量又远大于一个英文字母,分词器通常只能把常见的双字词合成一块,其余情况一个汉字就是一个 token,遇到人名、地名、专业术语和生僻字甚至会拆得更碎。折算下来,一个汉字大致相当于零点五到一个多 token,而一个英文字符只有零点二几。同样是一万个字符,纯中文材料可能是七八千 token,纯英文材料可能只有两三千。这就是本工具一定要问你「中文占比」的原因。有个实际推论值得记住:财报附注、访谈记录这类中文密集的材料,字数看着不多,喂进去却相当占地方;而代码、表格、英文原文反而没那么吃窗口。
这个估算的误差有多大?能当准数用吗?
不能,它只是量级参考。页面上给的是一个区间而不是单一数值,就是为了别让人把中间那个数当成精确值。误差主要来自三处。第一是分词器本身:不同模型用的分词器不一样,同一段中文切出来的 token 数差三四成很常见,同一家模型换个版本也可能变。第二是材料构成:表格、代码、数字串、大量换行和标点,它们的切分效率和普通行文差别很大,本工具只按中文与拉丁两档粗折算,碰上格式复杂的材料会偏。第三是我们主动做的简化:空白字符不计入统计,因为空格和换行在多数分词器里会被并进相邻的块,单独算一份会把中文材料的估算明显推高。所以正确的用法是:拿它判断「这份材料是几万还是几十万 token 的量级」「离窗口是差一点还是差一个数量级」,而不是拿它去精确规划预算。真要卡预算,就先小规模跑一次,看实际用量回执,再按比例外推。判断装不装得下时,请看区间的上沿而不是中间值。
为什么多轮对话比我以为的贵得多?
因为对话本身是没有记忆的。看起来它记得你上一句说了什么,实际的实现方式是:每问一次,就把材料和之前所有的问答重新完整地发送一遍。于是第一轮的输入是材料加一个问题,第二轮是材料加一问一答再加新问题,第三轮又多背上一组,越往后越沉。把它写成算式:聊 N 轮,材料要付 N 次钱,历史问答的累计量是按等差数列增长的,总量和轮数的平方成正比。这就是页面上那个倍数的来源——很多人心里估的是「材料付一次,后面几轮就是几句问答」,实际账单往往是这个天真口径的好几倍,而且轮数越多倍数越大。柱状图画的正是这件事:最底下那段材料每根柱上都有,中间那段历史一轮比一轮厚。三个实用推论:一是长材料尽量一次问清楚,别用聊天的方式挤牙膏;二是聊偏了就开新会话,而不是在旧会话里继续绕,旧会话的每一轮都在为一堆无关历史付费;三是有些工具会自动裁剪或缓存历史,那样实际用量会低于本工具的估算,具体要看你用的那个工具怎么做。
上下文塞满了会怎样?是不是只要不超就没事?
超过窗口的后果很直接:要么调用直接报错,要么工具替你把最早的那部分悄悄截掉,而后者更麻烦——你不会收到任何提示,只会发现它对材料开头的内容「记不清」了。但真正容易被忽略的是没超窗口时的另一种损耗:塞得越满,中间那一段的利用率越低。多个公开研究和大量实际使用都观察到同一个现象,模型对上下文开头和结尾的内容抓得比较牢,对夹在中间的内容注意力明显下降,材料越长这个凹陷越明显。这意味着把一份超长材料整个塞进去、然后问一个需要在中间部分找证据的问题,答不准的概率会上升,而它给出的答案通常照样很流畅、很笃定,你很难从语气上看出它其实没看到那一段。所以「装得下」和「用得好」是两回事。稳妥的做法是:即便窗口装得下,也优先只喂与问题相关的那部分;一定要喂全文时,把最关键的材料放在开头或结尾,并且对关键结论指定出处,要求它给出引用的原文片段,再自己回原文核一遍。
装不下的时候,分块、摘要、检索这三条路怎么选?
先问自己一个问题:我要问的这件事,需不需要把材料的前后两头放在一起对照?答案基本就决定了选哪条。如果不需要通篇对照,比如逐节提炼要点、分章节整理数据,分块最省事——切成几段分别问,费用大致按块数翻倍,代价是跨块的推理会断,模型看不到第一块和第八块之间的关系。如果需要通篇对照,且能接受损失细节,可以先摘要:压缩这一步本身要把全文过一遍,该付的输入费一分不少,省的是后面每一轮;但摘要必然按某种偏好取舍,丢掉的往往正是你后面想追问的细节,摘要环节要是把数字概括错了,后续所有结论都建在错的底座上,而你从对话里看不出来。如果这份材料要反复查很多次,那就值得搭检索:每轮只送进相关片段,长期最省,代价是要做切分和索引,而且风险换了位置——检索漏掉的内容,模型不会告诉你它没看到,只会拿手上那点材料自信作答。三条路的共同前提是:凡是要用于决策的数字,最后都得回一手资料核对一遍。

本工具仅为测算演示,不构成投资建议。计算结果受输入假设影响,实际情况请以官方规定与金融机构公布为准。

回到计算器