系统 / 工具 / 历史 / RAG / 输出分别算 token,堆叠条看占用、超窗提前预警
🔒 文件本地处理不上传
大模型的上下文窗口(context window)是一次请求里「输入 + 输出」共享的 token 总预算。一次真实调用往往由好几部分拼成,这个工具帮你把它们分开算、合起来看:
工具会分别计 token、用堆叠条展示各部分占了窗口的多少、还剩多少、会不会超窗,并顺带估算这次调用的费用。全部在浏览器本地完成,内容不上传服务器。
上下文窗口是输入和输出共用的。如果输入内容把窗口占满,模型就没有空间生成回复,会被截断甚至直接报错。因此正确的做法是:先扣掉预计的输出 token,剩下的才是真正能用于输入的额度。本工具把预留输出也画进堆叠条(灰色斜纹段),让你一眼看出「输入 + 输出」是否已经触顶。
当总占用超过窗口上限,堆叠条会画出一条窗口界线,界线右侧即为溢出部分。常见的压缩手段:
tiktoken 词表,token 数精确。分词、预算计算与成本估算均基于内置词表在你的浏览器本地运行,system prompt、对话历史、RAG 文档等内容都不会发送到任何服务器。
普通 Token 计算器算的是「一整段文本」的 token 数;上下文预算把一次请求拆成系统提示、工具定义、对话历史、RAG 检索、当前输入以及为回复预留的输出等几部分,分别计数并汇总,用堆叠条直观呈现各部分占了上下文窗口的多少,帮你判断会不会超窗、还能塞多少内容。
上下文窗口是「输入 + 输出」共享的总预算。如果输入把窗口占满,模型就没有空间生成回复,会被截断或直接报错。所以要先按预计回复长度预留一部分输出 token,剩下的才是真正能用于输入的额度。
超过窗口上限后,多数 API 会直接拒绝请求或从头/尾截断内容,导致丢失关键信息。工具会在超窗时用红色标出溢出的 token 数,并在堆叠条上画出窗口上限界线,提醒你压缩对话历史、精简 RAG 片段或改用更大窗口的模型。
OpenAI 系(GPT-4o 等)使用官方 tiktoken 词表,结果精确;Claude、Gemini、DeepSeek、通义、文心、GLM 等没有公开的浏览器分词器,用近似编码估算,界面会标注「估算值」,实际以各厂商官方计费为准。
不会。分词、预算计算与成本估算全部在你的浏览器本地完成,system prompt、对话历史、RAG 文档等内容都不会离开你的设备,适合含敏感信息的场景。