Token 是什么?从计数到控费的实战教程
Token 是什么:不要把它简单理解成“字数”
在调用 Claude、GPT 等大模型时,Token 是模型读取和生成文本的最小计费与处理单位。它不等于一个汉字、一个英文单词或一个字符,而是模型分词器把文本切成的片段。比如英文 “unbelievable” 可能被拆成多个 token;中文里一个汉字有时接近一个 token,但标点、空格、数字、代码符号都会影响结果。
理解 token 的意义很实际:它决定了你的请求能放多少内容、模型能回答多长、一次调用大概花多少钱。如果你在做客服机器人、代码助手、批量摘要或 RAG 检索应用,token 计算就是成本控制的第一步。
第一步:区分输入 Token 和输出 Token
一次 API 调用通常包含两部分 token。输入 token 是你发给模型的内容,包括 system 指令、用户问题、历史对话、工具定义、检索出来的文档片段等。输出 token 是模型生成的回答。
举个例子:你发送一段 3000 token 的产品文档,让模型总结为 500 token 的中文摘要,那么本次调用大约消耗 3500 token。多数模型会分别按输入和输出计价,输出 token 通常更贵,因为生成过程计算量更高。
第二步:用近似规则快速估算
在没有分词工具时,可以先用经验值估算。中文普通文本通常可以粗略按“1 个汉字约 1 个 token”估算;英文通常约“1 个 token 等于 3 到 4 个字符”或“100 个英文单词约 130 个 token”。代码、JSON、日志、长数字和大量标点会显著增加 token。
- 一段 1000 字中文说明书:大约 1000 到 1500 token。
- 一篇 800 词英文文章:大约 1000 到 1200 token。
- 一份带缩进的 JSON 配置:可能比同长度自然语言更耗 token。
- 多轮聊天记录会累积输入 token,越聊越贵。
第三步:用官方或 SDK 工具精确计数
生产环境不要只靠估算。对于 GPT 系列,可以使用对应 tokenizer 工具进行本地计算;对于 Claude 系列,应参考模型文档或使用接口返回的 usage 字段。很多 API 返回结果会包含类似 input_tokens、output_tokens、total_tokens 的统计,这才是最终计费依据。
实操建议是:在你的后端为每次请求记录模型名、用户 ID、输入 token、输出 token、响应耗时和请求场景。这样你能看出哪个功能最烧钱,是系统提示词太长、历史消息没裁剪,还是检索文档塞得太多。
第四步:理解上下文窗口,不是越大越好
上下文窗口 指一次请求中模型最多能处理的 token 总量,包含输入和输出。例如某模型支持 200K token,并不代表你应该每次都塞满。长上下文会增加成本、延迟和无关信息干扰。
更合理的做法是:只放当前任务必要的信息。做文档问答时,先用向量检索找出最相关的 3 到 8 个片段;做代码分析时,只传相关文件、函数和报错堆栈;做客服场景时,只保留最近几轮对话和关键用户画像。
第五步:设置 max_tokens 控制输出成本
很多开发者只关注输入,却忘了限制输出。API 参数里的 max_tokens 或 max_completion_tokens 可以限制模型最多生成多少 token。比如你只需要一句分类结果,就不要允许它生成 2000 token;你需要结构化 JSON,也应在提示词中明确字段和长度。
- 分类任务:输出限制 20 到 100 token。
- 摘要任务:按摘要长度限制 200 到 800 token。
- 代码生成:根据需求限制 1000 到 4000 token。
- 长文写作:分段生成,避免一次性超长输出失败。
第六步:用提示词和架构减少浪费
降低 token 成本不是简单换便宜模型,还要优化输入。首先,把重复的长提示词压缩成清晰规则,删除客套话。其次,对历史消息做摘要,只保留事实、偏好和未完成任务。再次,检索增强应用不要把整篇文档塞进 prompt,而是按相关度和长度筛选片段。
如果你有多种任务,可以做模型分层:简单分类、改写、抽取用更便宜的 Haiku 或小型 GPT;复杂推理、长代码和高质量写作用 Sonnet、Opus 或更强 GPT。这样既保证效果,又能显著降低平均成本。
第七步:为什么用 59API 调用更适合控费
当你已经会算 token,下一步就是选择稳定且便宜的 API 通道。59API 是面向开发者的 AI API 中转服务,API Base URL 为 https://api.59api.com,提供按量付费访问 Claude Opus、Sonnet、Haiku、Fable 以及 GPT 模型。它兼容 Claude Code、Codex 和任意 OpenAI SDK,迁移时通常只需要替换 base_url 和 key。
对成本敏感的团队来说,59API 的优势在于价格低、按需充值、无需大额预付,并且使用官方质量的原生模型,不做降级替换。你可以继续使用熟悉的 OpenAI SDK 写法,同时在后台观察 token 消耗,把不同任务路由到不同模型。它还提供邀请返利,适合有团队或开发者社群的用户进一步降低长期成本。
第八步:一个可执行的 Token 控费清单
- 上线前先用 20 到 50 条真实样本测试平均输入和输出 token。
- 为每个功能设置 max_tokens,不让模型无限发挥。
- 记录 usage 字段,按用户、模型和功能维度统计成本。
- 把长历史对话定期摘要,避免每轮重复发送全部内容。
- RAG 只传最相关片段,并限制每个片段长度。
- 简单任务使用低成本模型,复杂任务再升级到强模型。
- 定期检查提示词,删除重复规则、无效示例和冗余上下文。
总结一下,token 是大模型应用的“燃料单位”:输入越多、输出越长,成本和延迟通常越高。掌握计数方法、上下文管理和输出限制后,你就能更准确地预测账单。如果你正在构建 Claude 或 GPT 应用,可以试试 59API,用低成本、兼容主流 SDK 的方式快速接入并开始优化每一次调用。
¿Listo para empezar?
Conecta Claude y GPT en minutos a los precios más bajos, sin recortes. Regístrate para obtener tu clave API.
Registro gratis