Token 是模型处理信息时使用的基本单位。对文字而言,它可能对应一个字、一部分词、完整词或其他字符片段;怎么切分取决于具体分词器,因此字数、英文单词数和 Token 数没有固定的一一对应关系。

一句话理解:模型有自己的切分方式

分词器是把文本转换成 Token 序列的程序,英文叫 tokenizer。它会按相应规则和词表拆分文本,再用数字编号表示这些单位。这里的“分词”不一定符合中文语文课里的词语边界。

把文本想成拼块比较直观,但不是每块一样长,也不是所有模型使用同一套拼块。有的单位覆盖常见字符串,有的文本需要拆得更细。类比只说明单位大小可以不同,不代表系统一定按语义完整切分。

一个不需要计算器的例子

看两段教学用文本:“请总结这段话”和“请总结 AI_workflow_v2 这段话”。后者不仅多了几个可见字符,还混合了英文、下划线与数字。你不能根据字符增量,直接断言多了几个 Token。

同样,一个英文长词可能被拆成多个片段,一个中文词组也未必只有一个 Token。空格、标点和换行可能参与切分。实际结果应由对应模型使用的分词器或官方计数接口确认,这里不编造一组看似精确的数字。

两个分词器对同一段话给出不同结果并不奇怪。词表、算法和训练语料存在差异,某种语言中常见的表达,在另一套词表里可能需要更多单位才能表示。

为什么要关心它

第一,模型能处理的上下文容量通常用 Token 描述。一次对话并不只有你最新打出的文字,系统指令、历史消息、工具返回的材料也可能占用空间。输入看起来不长,并不表示整次请求很短。

第二,一些模型接口会按输入和输出用量计费。具体规则还可能涉及缓存、其他模态或服务项目,因此不能用“我写了多少字”直接推算账单。本文只解释单位,不提供价格或额度承诺。

第三,生成回答也需要空间。如果把可用输入空间都塞满,还要求一份很长的报告,可能遇到限制。不同服务对输入、输出及其他计算用量的规定不同,应该看服务文档,而不是套一个所有模型通用的减法。

字数要求和长度上限要分别处理

写“请用三百字回答”,是在提出内容要求,不是在精确设置三百个 Token 的上限。模型可能偏长或偏短。如果用于投稿、表格或消息长度限制,生成后仍应使用编辑器按你的规则统计字数。

反过来,把接口的输出上限设为某个 Token 数,也不能保证生成恰好同样数量的汉字。任务是否结束、模型输出内容以及服务的截断规则,都可能影响最终长度。

常见误区:省掉标点就一定更好?

没必要为了少几个单位,把材料压缩成难以理解的缩写。清晰的标题、换行和出处虽然占用空间,却可能帮助模型区分信息。更值得删掉的是重复内容、无关聊天和不需要的附件,而不是所有有助于理解的结构。

网上常见的“一个 Token 约等于几个字符”通常是特定语言或模型下的粗略估计。它可以帮助建立量级印象,不能变成中文文本、代码和所有产品的统一公式。图片和音频的用量也不能按文字字数直接计算。

小练习:设计一次可核对的观察

准备三段不含隐私的短文本:中文通知、同样意思的英文通知、带标点和换行的清单。如果你已有工具提供官方 Token 计数入口,可以分别观察,并记录使用的模型或分词器名称。

没有计数工具也不用申请接口。先在纸上写下预测:“哪两段可见字符差不多,但可能有不同 Token 数?”正确的学习目标不是猜中数字,而是知道为什么需要实际计数。

如果下一次换了工具,保留文本再比较时还要记录新的分词器。这样你得到的是有条件的观察,而不是把一次结果推广成固定规则。

参考来源

以下资料用于核对概念;正文与练习为本站重新组织的原创讲解,不是外文逐段翻译。

  1. Hugging Face LLM Course:Tokenizers

    词、字符与子词切分,以及不同分词器的差异。

    查阅:2026-09-19
  2. Google AI:Understand and count tokens

    输入输出计数与多模态用量;具体数值和计费行为仅适用于对应 Gemini 服务,本文不推广为通用换算。

    查阅:2026-09-19
  3. Google 机器学习速成课:Introduction to Large Language Models

    语言模型、Token 与上下文的基础定义。

    查阅:2026-09-19