
核心观点:如果你在用AI大模型(不管是用API还是自己部署),你一定见过"Token"这个词。但绝大多数人并不真正理解Token是什么、为什么大模型按Token收费、以及怎么估算自己的Token成本。这篇文章把Token这件事讲透——从最底层的技术原理,到最实用的成本估算方法,一次性搞清楚。这篇文章尤其适合OPC(一人公司)读者——因为Token就是OPC的生产资料,不懂Token成本,就没法做服务定价。

先回答最底层的问题:Token到底是什么?
大语言模型(LLM)不直接处理文字——它处理数字。
当你输入"你好,世界",模型看到的不是这四个汉字,而是一个数字序列,比如[123, 456, 789, 012]。
每一个数字,就是一个Token。
更准确地说:
- Token是大模型处理文本的最小单位
- 英文:一个Token大约=0.75个单词(平均)
- 中文:一个Token大约=0.5-1.5个汉字(取决于分词算法)
- 代码:一个Token大约=3-4个字符
举例:
| 文本 | Token数(GPT-4 tokenizer) |
| "Hello world" | 2 tokens |
| "你好世界" | 4 tokens |
| "def fib(n): return n if n<2 else fib(n-1)+fib(n-2)" | ~15 tokens |

为什么大模型按Token收费,不按字数收费?
因为大模型的计算成本是按Token算的,不是按字数算的。
大模型推理(generate response)的过程,简化版是这样的:
- 把输入文本切成Token序列
- 每个Token做一次矩阵乘法(在GPU上跑)
- 输出一个Token
- 把输出的Token append到序列里,重复步骤2-3,直到输出完毕
输入有多少个Token,就要做多少次矩阵乘法。输出有多少个Token,就要做多少次矩阵乘法。
所以按Token收费,是对GPU算力消耗的直接度量——不是拍脑袋定的价格。

OpenAI/Anthropic/国内大模型的Token定价对比
以下是2026年7月的最新API定价(输入/输出分开计费,因为输出的计算量是输入的数倍):
| 模型 | 输入价格(每M Token) | 输出价格(每M Token) | 备注 |
| GPT-4.1 | $2.50 | $10.00 | 最新旗舰 |
| Claude 4 Sonnet | $3.00 | $15.00 | 推理能力强 |
| 文心5.0 | ¥18 | ¥60 | 中文优化 |
| 通义3.0 | ¥15 | ¥50 | 性价比高 |
| 混元Pro | ¥12 | ¥45 | 腾讯生态整合 |
一眼能看到的区别:输出的价格通常是输入的3-5倍。因为输出是"逐Token生成"的,计算量是输入的3-5倍。
怎么估算你自己的Token成本?
这是最实用的一节。
假设你做了一个AI应用(比如"AI简历优化器"),用户每次提交简历,你的应用调用大模型API处理。
场景假设:
- 平均每次请求:输入500 Token,输出1500 Token
- 每天请求量:1000次
- 使用模型:文心5.0
成本计算:
- 每日输入Token:500 × 1000 = 500,000 = 0.5M Token
- 每日输出Token:1500 × 1000 = 1,500,000 = 1.5M Token
- 每日API成本:0.5M × ¥18/M + 1.5M × ¥60/M = ¥9 + ¥90 = ¥99/天
- 每月API成本:¥99 × 30 = ¥2970/月

OPC视角:Token成本怎么压?
如果你是OPC(一人公司),Token是你最大的变动成本——每多一个用户,就多一份Token开销。
压Token成本的三招(按效果排序):
第一招:模型路由(最重要)不是所有任务都需要旗舰模型。
- 简单任务(分类、摘要、改写)→ 用便宜的小模型(¥2-5/M Token)
- 复杂任务(推理、代码生成)→ 用旗舰模型
这一招能把Token成本压低50-70%。前面07-02的「算力项目实战」详细写过具体实现。
第二招:Prompt压缩同样的任务,Prompt写得越长,输入Token越多,成本越高。
- 删掉Prompt里的废话("你是一个有用的AI助手……")
- 用few-shot代替long instruction
- 这一招能压低输入Token 10-30%
第三招:缓存重复输出如果同一个问题被问了100次,第一次调用API,后面99次直接返回缓存结果。
- OpenAI API支持Prompt Caching(自动的)
- 自己实现缓存也不难(用Redis,key=hash(prompt))
- 这一招能压低输出Token 20-50%(取决于重复率)

自部署 vs API:什么时候自部署更划算?
这是OPC最纠结的问题。
简单规则:如果你的日均输出Token超过5亿Token/天,自部署开始比API更划算。
算给你看:
- 5亿输出Token/天,用文心5.0 API:5亿 × ¥60/M = ¥3000/天 = ¥9万/月
- 租一台B300(23万/月),可以输出大约多少Token?B300的推理吞吐量约2000 Token/s/GPU × 8 GPU = 16000 Token/s = 约400亿Token/天
- 所以:如果你的用量>5亿Token/天(API成本9万/月),租B300(23万/月)看起来更贵——但:自部署可以用开源模型(Llama 4、Qwen 3),Token边际成本接近0API是按调用次数付费,自部署是固定成本——用量越大,摊得越薄
结论:OPC在早期(<1亿Token/天)用API;中期(1-10亿Token/天)混合;后期(>10亿Token/天)自部署。
一句话总结
Token是大模型世界的"货币"——你用多少算力,就付多少Token的钱。不懂Token成本,就没法给AI服务定价;不懂怎么压Token成本,OPC就赚不到钱。

你现在的Token成本是多少?你用的是什么模型?有没有走过模型路由?留言区聊聊。
安徽云联万佳信息科技有限公司