Token 计数原理
大模型按 token(不是字符)计费与限长;中文通常 1–2 字一个 token,英文约 4 字母一个 token
本工具用近似分词估算,与官方有小幅偏差
这个工具能做什么
- 估算文本的 token 数
- 辅助控制 prompt 长度与费用
- 本地估算,不上传
怎么使用(输入说明)
- 输入文本:粘入待发送的内容。
- 查看 token 数:实时估算,可对照模型上下文上限。
算出来的 token 和官方一致吗
近似算法与各家分词器(如 BPE)有小幅差异,量级准确、可用于预估;要精确值请以对应模型官方 tokenizer 为准。
计算实例
例:约 100 个汉字通常对应 150–200 token;长 prompt 建议先估算避免超窗口。
常见问题 FAQ
Q:算出来的 token 数和官方一致吗?
A:本工具采用 cl100k_base(GPT-3.5/4/4o 通用分词器),对英文与代码还原度高;中文按子词切分,结果与实际计费口径非常接近,适合估算,精确账单以厂商为准。
Q:我的文本会被上传吗?
A:不会。分词完全在浏览器本地进行,文本不上传任何服务器,可放心粘贴含敏感内容的文本。