算力百问 | 什么是Token?大模型的Token到底怎么算钱?

算力百问 | 什么是Token?大模型的Token到底怎么算钱?

技术分享 2026-07-09 来源 博士算力猎场 65
算力百问 | 什么是Token?大模型的Token到底怎么算钱?

微信图片_2026-07-09_101610_202.jpg

核心观点:如果你在用AI大模型(不管是用API还是自己部署),你一定见过"Token"这个词。但绝大多数人并不真正理解Token是什么、为什么大模型按Token收费、以及怎么估算自己的Token成本。这篇文章把Token这件事讲透——从最底层的技术原理,到最实用的成本估算方法,一次性搞清楚。这篇文章尤其适合OPC(一人公司)读者——因为Token就是OPC的生产资料,不懂Token成本,就没法做服务定价。

微信图片_2026-07-09_101614_720.jpg

先回答最底层的问题:Token到底是什么?


大语言模型(LLM)不直接处理文字——它处理数字。


当你输入"你好,世界",模型看到的不是这四个汉字,而是一个数字序列,比如[123, 456, 789, 012]。


每一个数字,就是一个Token。


更准确地说:


  • Token是大模型处理文本的最小单位
  • 英文:一个Token大约=0.75个单词(平均)
  • 中文:一个Token大约=0.5-1.5个汉字(取决于分词算法)
  • 代码:一个Token大约=3-4个字符

举例:

文本Token数(GPT-4 tokenizer)
"Hello world"2 tokens
"你好世界"4 tokens
"def fib(n): return n if n<2 else fib(n-1)+fib(n-2)"~15 tokens



微信图片_2026-07-09_101622_969.jpg

为什么大模型按Token收费,不按字数收费?


因为大模型的计算成本是按Token算的,不是按字数算的。


大模型推理(generate response)的过程,简化版是这样的:


  1. 把输入文本切成Token序列
  2. 每个Token做一次矩阵乘法(在GPU上跑)
  3. 输出一个Token
  4. 把输出的Token append到序列里,重复步骤2-3,直到输出完毕

输入有多少个Token,就要做多少次矩阵乘法。输出有多少个Token,就要做多少次矩阵乘法。


所以按Token收费,是对GPU算力消耗的直接度量——不是拍脑袋定的价格。

微信图片_2026-07-09_101627_035.jpg

OpenAI/Anthropic/国内大模型的Token定价对比


以下是2026年7月的最新API定价(输入/输出分开计费,因为输出的计算量是输入的数倍):

模型输入价格(每M Token)输出价格(每M Token)备注
GPT-4.1$2.50$10.00最新旗舰
Claude 4 Sonnet$3.00$15.00推理能力强
文心5.0¥18¥60中文优化
通义3.0¥15¥50性价比高
混元Pro¥12¥45腾讯生态整合

一眼能看到的区别:输出的价格通常是输入的3-5倍。因为输出是"逐Token生成"的,计算量是输入的3-5倍。


怎么估算你自己的Token成本?


这是最实用的一节。


假设你做了一个AI应用(比如"AI简历优化器"),用户每次提交简历,你的应用调用大模型API处理。


场景假设:


  • 平均每次请求:输入500 Token,输出1500 Token
  • 每天请求量:1000次
  • 使用模型:文心5.0

成本计算:


  • 每日输入Token:500 × 1000 = 500,000 = 0.5M Token
  • 每日输出Token:1500 × 1000 = 1,500,000 = 1.5M Token
  • 每日API成本:0.5M × ¥18/M + 1.5M × ¥60/M = ¥9 + ¥90 = ¥99/天
  • 每月API成本:¥99 × 30 = ¥2970/月

微信图片_2026-07-09_101630_668.jpg

OPC视角:Token成本怎么压?


如果你是OPC(一人公司),Token是你最大的变动成本——每多一个用户,就多一份Token开销。


压Token成本的三招(按效果排序):


第一招:模型路由(最重要)不是所有任务都需要旗舰模型。

  • 简单任务(分类、摘要、改写)→ 用便宜的小模型(¥2-5/M Token)
  • 复杂任务(推理、代码生成)→ 用旗舰模型

这一招能把Token成本压低50-70%。前面07-02的「算力项目实战」详细写过具体实现。


第二招:Prompt压缩同样的任务,Prompt写得越长,输入Token越多,成本越高。

  • 删掉Prompt里的废话("你是一个有用的AI助手……")
  • 用few-shot代替long instruction
  • 这一招能压低输入Token 10-30%

第三招:缓存重复输出如果同一个问题被问了100次,第一次调用API,后面99次直接返回缓存结果。

  • OpenAI API支持Prompt Caching(自动的)
  • 自己实现缓存也不难(用Redis,key=hash(prompt))
  • 这一招能压低输出Token 20-50%(取决于重复率)

微信图片_2026-07-09_101630_668.jpg

自部署 vs API:什么时候自部署更划算?


这是OPC最纠结的问题。


简单规则:如果你的日均输出Token超过5亿Token/天,自部署开始比API更划算。


算给你看:


  • 5亿输出Token/天,用文心5.0 API:5亿 × ¥60/M = ¥3000/天 = ¥9万/月
  • 租一台B300(23万/月),可以输出大约多少Token?B300的推理吞吐量约2000 Token/s/GPU × 8 GPU = 16000 Token/s = 约400亿Token/天
  • 所以:如果你的用量>5亿Token/天(API成本9万/月),租B300(23万/月)看起来更贵——但:自部署可以用开源模型(Llama 4、Qwen 3),Token边际成本接近0API是按调用次数付费,自部署是固定成本——用量越大,摊得越薄

结论:OPC在早期(<1亿Token/天)用API;中期(1-10亿Token/天)混合;后期(>10亿Token/天)自部署。


一句话总结

Token是大模型世界的"货币"——你用多少算力,就付多少Token的钱。不懂Token成本,就没法给AI服务定价;不懂怎么压Token成本,OPC就赚不到钱。

微信图片_2026-07-09_101640_385.jpg

你现在的Token成本是多少?你用的是什么模型?有没有走过模型路由?留言区聊聊。

上一篇
北京发布全国首个标准化 Token(词元)工厂

相关推荐

智算中心液冷技术选型指南:浸没式vs冷板式
智算中心液冷技术选型指南:浸没式vs冷板式

2026-04-06

微信二维码
微信咨询
扫码添加企业微信
获取专属服务方案
微信号:yunlianwanjia
电话