Skip to content
编程开物
编程开物

一段代码,一段Prompt,一物成型。 探索编程、AI应用、架构设计与产品设计,分享工程实践,记录技术学习、工作总结与产品创造。

  • 首页
  • 编程基础
    • 计算机网络
  • 人工智能
    • AI概念和理论
    • 人工智能应用
    • 数据工程
  • 企业架构
    • 传统应用架构设计
    • AI应用架构设计
  • 项目管理
  • 产品设计
  • 技术教程
  • 行业动态
  • 关于我
编程开物

一段代码,一段Prompt,一物成型。 探索编程、AI应用、架构设计与产品设计,分享工程实践,记录技术学习、工作总结与产品创造。

Token经济:从10亿亿到3500亿亿,Token正在形成智能经济模型

编码者, 2026年9月16日2026年9月16日

引子:一个值得暂停一下的数字

2026年3月23日,中国发展高层论坛年会上,国家数据局局长刘烈宏说了一句话:

“Token不仅是智能时代的价值锚点,更是连接技术供给与商业需求的’结算单位’,为商业模式的落地提供了可量化的可能。”

同一天公布的数据是:中国日均Token调用量突破140万亿。 而在2024年初,这个数字是1000亿——两年增长超过一千倍。

这不是一条可以轻描淡写滑过去的曲线。它意味着在两年时间里,一种此前几乎不存在的”消耗品”,成了整个国家数字经济的基础口径之一。

于是行业里开始流行一个说法:Token是AI时代的”算力货币”。

这个比喻听起来很顺,但经不起推敲。本文想讲清楚三件事:Token像钱的地方在哪里、不像钱的地方在哪里,以及为什么它真正的意义,可能比”钱”这个类比更大。


一、先看现象:一场持续两年的”通胀式通缩”

要理解Token,先要理解一个很反直觉的事实:Token的价格在暴跌,但所有人花在Token上的钱在暴涨。

先看价格这一侧。

2023年3月GPT-4发布时,API价格是每百万输入Token 30美元、输出60美元。到2026年,同等智能水平的调用成本已经降到原来的零头——整体降幅超过99%,部分场景接近99.9%。

价格降了就不回去,能力还不打折。

但降价只是故事的一半。几乎在同一时间,另一种定价方式出现了:峰谷分时计价。

DeepSeek随V4 Pro正式版(8月13日发布)引入分时计费,自8月16日起生效,高峰时段(工作日9:00-12:00、14:00-18:00)价格为空闲时段的两倍。按9月10日调价后的官方定价,以每百万Token计:

  • deepseek-flash输入缓存命中 空闲0.02元/高峰0.04元;输入未命中 空闲1元/高峰2元;输出 空闲4元/高峰8元
  • deepseek-v4-pro输入缓存命中 空闲0.15元/高峰0.30元;输入未命中 空闲4.5元/高峰9元;输出 空闲13.5元/高峰27元

Token正在像电费一样,开始按”用电时段”计价。 这个细节比单纯降价更能说明问题——它意味着供给端已经出现了真实的紧张。

再看消费这一侧。

按常理,单价降了99%,账单应该跟着缩水。但数据给出的答案完全相反:

  • 中国日均Token调用量从2024年初的1000亿,涨到2025年底的100万亿,再到2026年3月的140万亿;
  • 据IDC数据,全球AI支出从2022年的约1180亿美元,预计到2026年突破3000亿美元;
  • 企业平均AI预算从2024年的年均120万美元,涨到2026年的700万美元,翻了近6倍。

单价跌了两个数量级,总花费反而翻了两倍。

这个现象有个161年前的名字:杰文斯悖论。

1865年,英国经济学家威廉·斯坦利·杰文斯研究了一个当时匪夷所思的问题——蒸汽机效率大幅提升之后,英国的煤炭消耗量为什么不但没降,反而暴涨了十倍?

他的答案是:效率提升让使用成本下降,成本下降让原本不划算的应用变得划算,新应用大量涌现又推高了总需求,最终总消耗不降反升。

2026年的AI行业,把这个逻辑完整复刻了一遍。一位SaaS公司高管的形容很传神:

“就像水费从10元一吨降到1元一吨,结果你家用水量从每月1吨变成100吨——因为你突然觉得浇花园、洗车、冲游泳池都变得几乎不花钱了。”


二、真正的推手:Agent把单次消耗拉高了百倍

如果只是对话场景的用量增长,还不足以解释千倍级的爆发。真正改变游戏规则的,是Agent(智能体)。

过去用大模型,基本是一问一答:用户提问、模型回答,一次交互消耗几千到几万Token,成本可控,预算可预测。

现在的工作模式变成了”你下指令,它去执行”。一个Agent完成一次任务,需要经过需求拆解、多轮检索、反复校验、失败重试、结果整合等环节,每个环节都要调用模型。

结果是:Agent单次任务的Token消耗,是普通对话的10到100倍,复杂场景甚至能达到500倍。

这不是理论推演,账已经开始算了。几个真实案例:

  • Uber在公司内部推行”Token最大化”激励,把AI使用量和员工KPI挂钩,结果4个月就耗尽了全年AI编程预算。五千多名工程师人均月消耗500至2000美元,公司被迫紧急设置每人每月1500美元的上限。
  • 微软在给开发者开通某编程工具许可证6个月后撤销了权限。表面理由是整合内部生态,但恰逢财年末,成本控制的动机同样清晰。
  • Gartner 2026年调研显示,重度使用AI编程工具的开发者,单月Token消耗可达2万美元,是原固定订阅成本的数十倍。

所以2026年上半年,几乎所有头部企业都完成了一次转向:从”鼓励全员不限量使用AI”,变成”Token配给制”。

这大概是AI进入企业后最真实的一面——它不是一个”买了就省”的工具,而是一个需要被精细管理的成本项。


三、然后是关键问题:Token到底是不是钱?

行业里对Token有两种流行的货币化比喻:一种叫”算力货币”,强调它与算力消耗挂钩;一种叫”计算货币”,强调它作为智能计量单位的属性。两个提法指向同一件事——把Token当作某种货币单位来看待。

但如果认真对照货币的三大经典职能,Token几乎在每一项上都显得力不从心。

作为价值尺度,它确实是AI服务的定价单位,但不同厂商的Token价格相差数百倍,无法提供稳定的价值参照。

作为流通手段,它实现了法币到AI服务的单向兑换,但不具备通用流通性——出了AI这个场景,它什么都买不了。

作为储藏手段,它的通缩趋势明显,持有预付Token只会持续贬值,完全不具备保值功能。

更直白地说:一枚OpenAI的Token,不能在Anthropic的平台上使用;一枚开源小模型的Token,和一枚旗舰模型的Token,在成本和价值上也不等价。

它更像游乐场代币或预付费卡——限定场景、不可互换、没有独立信用体系。

上海交通大学史占中教授在《Token经济学》系列中的总结很到位:

“Token不是货币,类似于电力世界的千瓦时。千瓦时不是货币,但它衡量了电气化时代的生产力。”

这个类比,可能是理解Token最好的一把钥匙。

也正因为如此,Token承担了一个历史上很罕见的双重角色:它一方面是”成本度量”,衡量算力的物理消耗;另一方面又是”价值度量”,衡量智能输出的效用。传统货币只承担后一种职能,而Token两样都要干。

这带来的直接后果是:Token的价值高度不均质。

业界常用来描述这种差异的一组估算是:同为百万Token的调用,用于闲聊可能只值0.01美元,用于代码生成可到200美元,用于法律文书审阅可达1000美元。(这组数字是行业分析中的量级估算,用于说明价值差异,并非精确统计。)

价值不取决于生产成本,而取决于它被用来做什么。

这也是为什么用Token消耗量去衡量经济产出会失效——生产性消耗和消费性消耗被混在了一起。 把支持关键商业决策的Token和漫无目的闲聊的Token不加区分地加总,这个数字对衡量经济产出几乎没有意义。


四、一个更值得关注的信号:价格正在分层

前面提到,降价潮里同时出现了峰谷涨价。这不是矛盾,而是信号:需求旺到供给端承压,才可能有定价权。 如果只是一路向下杀价,说明大家在抢存量;出现了因需求过旺而涨价,说明增量真的来了。

比峰谷定价更值得看的,是整个价格体系正在分层固化:

  • 经济型模型价格半衰期仅1.1年,即每约1.1年价格减半,速度快于传统摩尔定律;
  • 中端模型价格半衰期1.55年,同样保持快速下行;
  • 旗舰模型基本不遵循统一降价规律,定价由推理能力溢价和产品版本策略主导,维持显著溢价。

走得更极端的是智谱GLM-5.1:面向编程与Agent场景的定价,是基础通用模型的3倍。

分层在2026年9月的最新价格上看得更清楚。按各厂商9月公开定价(单位:元/百万Token,取空闲时段):

  • 极致低价档DeepSeek Flash 输入缓存命中0.02元;通义千问Qwen3.7 Flash约0.2元
  • 主力实用档DeepSeek V4 Pro 输入4.5元/输出13.5元;字节Seed系列输入0.8元起
  • 国产旗舰档通义千问Qwen3.7 Max约10元;智谱GLM-5.1约6.5元
  • 海外旗舰档GPT-5.5 输入约5美元/输出30美元;Claude Opus系列5美元/25美元

同一时刻,最便宜的Token和最贵的Token,价差在两个数量级以上。

国际市场的分层更悬殊。2026年7月,前沿模型输入Token价格从0.14美元/百万Token到30美元/百万Token,价差超过200倍。

用一句话概括这个趋势:基础能力在被快速商品化,而真正能解决复杂问题的能力,越来越贵。 Token定价正在从”成本定价”向”任务价值定价”迁移。

还有一个细节值得注意:价格战打到现在,出现了”版本换价格”的新玩法。 9月9日DeepSeek宣布,在V4.1 Pro上线前,会把V4 Pro的请求全部路由到V4.1 Flash,并按Flash的单价计费——而V4.1 Flash在基准测试中的表现,超越了不少旗舰模型。这意味着”便宜”和”强”之间的边界,正在被抹平。

说明:以上价格均为写作时(2026年9月)的公开信息,各家定价调整频繁,实际以官网为准。海外模型价格按当期汇率折算,不同口径下数字会有差异。


五、中国在这件事上的位置

这一轮Token经济的扩张里,中国有几个值得单独看的位置。

第一,调用量的反超。

根据OpenRouter数据测算,2026年8月31日至9月6日当周,全球AI大模型总调用量为115万亿Token。其中:

  • 中国AI大模型周调用量:56.72万亿
  • 同期美国AI大模型周调用量:16.54万亿

中国大模型周调用量连续十九周超过美国,稳居全球首位。

第二,成本结构的差异。

中国模型能把价格打到美国的几十分之一,结构性成本优势是关键:国内工业用电价格比美国低30%-40%,中西部绿电成本低50%-70%,而电力成本约占推理运营总成本的60%-70%。

这不是靠补贴维持的低价,是生产要素的真实差异。也因此,电力正在成为Token定价的中期硬约束——芯片成本可以靠架构创新持续压缩,但电力受物理定律限制。

第三,基础设施开始出现。

以硅基流动为代表,这家成立三年的公司将芯片适配、推理引擎调优等工程能力封装成标准API,2025年营收同比增长653%,已向港交所递交上市申请。在Token单价暴跌的同时,它的营收反而在暴增——因为总调用量的增长速度,远超单价下跌的速度。

第四,政策层面也在同步推进。

2026年9月11日,国务院常务会议专门研究部署国家算力网建设工作,提出坚持合理布局、规范有序,完善算力基础设施,加速关键技术装备研发,构建多层次网络化算力体系,依托市场机制激发企业创新活力,打通算力供需匹配堵点。

而在9月12日的2026中国算力大会上,全国算力”一张网、一盘棋、一体化”的发展格局被宣布基本形成,全国算力统筹监测平台正式落地。

这件事的意义在于:Token的供给正在从”各家企业自己想办法”变成”国家级基础设施。 就像电力从各家自建发电机走向统一电网一样,这是token经济能否真正规模化的前提。

第五,金融化的第一步。

2026年5月,芝商所(CME Group)宣布与GPU市场情报公司Silicon Data合作,推出首创的算力期货市场,标的为全球首个针对按需GPU租赁价格的每日基准指数。芝商所董事长兼CEO Terry Duffy在公告中说了一句话:

“算力是数字经济的支柱,也是21世纪的’新石油’……算力正迅速演变为一种独立的资产类别。”

按后续公开信息,CME计划于2026年10月5日推出具体的算力期货合约。需要说明的是,截至本文写作时,这一产品仍处于推进过程中,最终形态和上线时间以官方公告为准。


六、那么,接下来会涨到什么程度?

讲完现状,再看未来。

关于中国Token用量的增长天花板,目前已经有几份来自不同机构的预测。但先说一个重要的提醒:这些数字不能直接横向比较,因为口径不同——有的统计的是”调用次数”,有的是”Token数量”,有的是”推理Token消耗”。我把它们放在一起,是为了让你看到趋势的共识,而不是让你去抠数字。

第一份,来自中国电信研究院,时间最新。

2026年9月12日,在河北廊坊举办的2026中国算力大会上,中国电信研究院发布了《智能体时代AI基础设施发展研究报告(2026)》。该院行业与企业战略研究所所长饶少阳给出的预测是:

  • 2026年国内词元年消耗量有望达到10亿亿
  • 2030年这一数值将突破3500亿亿
  • 期间年复合增长率接近12倍(即每年翻约12倍)

报告还指出了一个结构性变化:推理算力的需求规模将远超训练算力,预计到2029年,推理算力在国内算力市场中的占比将达到80%。同时预估未来2至3年,国内算力需求年均增幅接近10倍。

第二份,来自艾媒咨询,颗粒度最细。

艾媒咨询《2026年中国词元经济产业链全景分析报告》给出的数字是:

  • 2025年中国词元调用总量24,619.3万亿次
  • 2026年预计增至111,799.5万亿次
  • 2030年预计攀升至7,046,680.4万亿次
  • 2025–2030年复合增长率(CAGR)为210%

注意,这份预测里2026年的增速是354%,而到2030年的复合增速降到210%——也就是说,增速会逐步放缓,但基数已经大到即便放缓也是天文数字。

第三份,来自摩根大通,聚焦推理侧。

摩根大通预测,中国AI推理Token消耗量将从2025年的约10千万亿,增长至2030年的约3900千万亿,五年间增长约370倍。

第四份,来自蚂蚁集团,视角在生产关系。

2026年5月26日的支付宝AI支付生态大会上,蚂蚁集团研究院院长庄蹯预测:到2030年,AI领域Token消耗量将增长超300倍,活跃智能体达22亿,年执行任务400万亿次。

第五份,来自高盛,是全球视角。

高盛研究预计,AI智能体的Token使用量将从2026年起至2030年增长24倍,届时每月处理的Token数量将达到120千万亿。高盛把增长拆成了两端:

  • 消费端到2030年Token需求增长12倍,驱动力是”常驻后台智能体”——用户说一句”帮我订张机票”或”整理我的收件箱”,智能体在后台自主完成整个链路;
  • 企业端普及速度慢得多。高盛预测2030年只有12%的知识工作者在使用AI智能体,到2040年才上升到37%,呈现典型的长尾采纳曲线。

高盛分析师Jim Schneider用一句话点出了这种放大效应的量级:

“这就像把一个简单的聊天请求放大10倍、20倍、50倍。”

(注:不同机构对Agent的Token放大倍数测算区间不同,大致落在10倍至500倍之间,取决于任务复杂度与工具调用轮次。)

这些预测里,有三个判断比具体数字更重要:

一是增长动力来自结构变化,不是用户变多。 中国电信研究院直接点明,行业竞争重心正从”大模型、算力比拼”转向”智能体规模化落地与商业应用变现”。换句话说,调用量的爆发不是因为更多人开始用AI,而是因为同一批人开始让AI干更多的活。

二是推理算力会成为绝对主体。 2029年推理占比80%这个数字很关键——它意味着AI产业的主战场正在从”训练更聪明的模型”转向”让模型替人干活”。训练是一次性投入,推理是持续开销。

三是成本下降和用量上升会形成剪刀差。 高盛指出,芯片厂商每年正以60%至70%的速度降低每Token的推理成本。成本快速下降,而用量增长更快,这也是高盛认为超大规模云厂商和模型提供商将在未来3至12个月迎来毛利率正向拐点的核心逻辑。

不过也要说清楚这些预测的不确定性:所有机构都假设了Agent会在企业和消费端大规模落地,而这个假设本身还在验证中。高盛自己也承认,企业端普及会”慢得多”——一个Agent不仅要能跑,还要经过反复测试、与现有代码库集成、满足合规和监管要求。”写一段代码远比订一张机票复杂得多。”

更现实的问题是Token的浪费。Uber和微软都开始收紧高成本的智能体用量,高盛把这形容为”生产力与Token浪费之间的博弈“。

所以更准确的表述是:方向是确定的,斜率是不确定的。


七、所以,这件事到底意味着什么

看完这些数字,我想说的是:纠结”Token是不是货币”,其实是问错了问题。

Token大概率不会是货币。它的终局形态,更可能是一种“智能经济的基础计量协议”——用来定义智能服务交换的标准单位与规则。

这个判断有历史参照。十九世纪末电力商业化初期,各家公司的电压、频率、计费方式五花八门,彼此不可互通。经过几十年的标准化、公用事业监管和市场化交易,电力才成为今天的普惠基础设施。Token现在恰恰处在类似的”前标准化”阶段。

在这个阶段里,有两件事我认为是确定的。

第一,我们第一次能够量化和交易”智能服务”本身。

经济学史上,我们计量过劳动力时间,计量过度电度数,计量过带宽和存储。但把”思维产出”拆解为可量化、可交易的原子单位,这是第一次。

第二,Token的主要消耗主体,正在从人转向机器。

过去AI的用量跟着人类的时间走——一个人每天能用AI的时间是有限的。但当Agent可以24小时运行,消耗就不再受作息限制;当多Agent系统开始递归调用(Agent调用Agent、再由其他Agent校验结果),每一层都会叠加成本。

这意味着Token经济的上限,不再由人口规模或人类时间决定,而是取决于整个经济体系能创造的价值总量,以及背后的算力与能源供给能力。

一个”用更少Token创造更多价值”的能力,可能正在成为一种新的生产力指标。


最后

Token价格的暴跌,不是AI泡沫破裂的信号,反而是产业从”技术概念”走向”商业交付”的分水岭。当智能变得像水电一样便宜,真正的商业价值就不再诞生于”谁卖得更便宜”,而是诞生于“谁能在这场海量的Token消耗中,真正解决问题、创造价值”。

降价潮会继续。但总账单不会降。

因为人的欲望,永远跑得比技术降本的速度快一点。

参考资料:

  1. 中国政府网:《我国日均词元调用量突破140万亿》(2026-03-24)
  2. 中国政府网:《国家数据局局长刘烈宏:围绕Token的调用、分发与结算,一套新的价值体系正在加速演进形成》
  3. 36氪《Token经济学》系列第五期:《Token并不等同于”货币”》(2026-04-27,作者:上海交通大学行业研究院”人工智能+”行业研究团队负责人、安泰经管学院教授 史占中)
  4. 智元深维:《Token降了99%,企业账单却涨了3倍:AI行业的杰文斯悖论》(2026-07-12)
  5. 芝商所官网:《芝商所与Silicon Data联手推出首个算力期货》(2026-05-20)
  6. 21世纪经济报道:《全球首个算力期货,来了》(2026-08-12)
  7. OpenRouter 周调用量数据(2026-09-07 统计)
  8. 长江证券研报:《Tiered Super-Moore’s Law》相关引用(2026-06)
  9. IDC 全球AI支出数据
  10. 中国电信研究院:《智能体时代AI基础设施发展研究报告(2026)》(2026-09-12,2026中国算力大会发布;预测人:行业与企业战略研究所所长 饶少阳)
  11. 艾媒咨询(iiMedia Research):《2026年中国词元经济产业链全景分析报告》(2026-04-09)
  12. 摩根大通:中国AI推理Token消耗量预测(引自人民邮电报《日均Token调用量达140万亿》)
  13. 蚂蚁集团研究院:2030年AI Token消耗量预测(2026-05-26 支付宝AI支付生态大会,研究院院长 庄蹯)
  14. 高盛研究(Goldman Sachs Research):AI智能体Token使用量预测(分析师 Jim Schneider)
  15. IT之家:《DeepSeek 将继续提供 V4 Pro API 调用服务:原定 9 月 14 日下线,计费方式保持不变》(2026-09-11,含官方定价表)
  16. DeepSeek 官方公告:Flash系列模型降价(2026-09-09 发布,9月10日12:00起执行)
  17. 腾讯混元:Hy4 preview 发布并开源(2026-08-28)
  18. 各厂商公开定价页面(2026年9月)

说明:本文中涉及未来预测的表述(如高盛、摩根大通、IDC、艾媒咨询、中国电信研究院的预测)均为相关机构的观点,非已发生事实。特别是各家机构对Token用量的统计口径不一致(部分为”调用次数”、部分为”Token数量”、部分为”推理Token消耗”),数字之间不具备直接可比性,请勿跨机构横向对比或引用。文中所有模型价格均为2026年9月公开信息,AI模型定价调整频繁且存在峰谷、缓存等复杂计费规则,实际以各厂商官网为准。Token相关数据存在不同口径,正文已标注来源,请以原始出处为准。

你上个月AI账单花了多少?评论区聊聊。

Post Views: 2
行业动态 TokenToken经济智能经济词元词元经济

文章导航

Previous post

发表回复 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

站内搜索

微信公众号

广告赞助

近期文章

  • Token经济:从10亿亿到3500亿亿,Token正在形成智能经济模型
  • 第 2 章 LLM Application 的基本架构
  • 第 1 章 重新认识 AI Agent
  • 《AI Agent 架构设计与工程实践指南》——从 LLM、Agent、Harness 到 Mini Claude Code
  • 2025年企业级编程技术栈趋势简报
  • 构建高效智能体【译】
  • 软件系统架构演进:单体、微服务和打包业务能力(PBC)
  • 免费HTTPS证书配置 :CentOS 7 + Nginx + Let’s Encrypt 全流程指南
  • AI编程实战001:从0打造网页版打字游戏《快乐打地鼠》
  • 机器学习三要素:模型假设、评价函数与优化算法如何协同工作

近期评论

  • 《AI Agent 架构设计与工程实践指南》——从 LLM、Agent、Harness 到 Mini Claude Code - 编程开物 发表在《第 2 章 LLM Application 的基本架构》
  • 《AI Agent 架构设计与工程实践指南》——从 LLM、Agent、Harness 到 Mini Claude Code - 编程开物 发表在《第 1 章 重新认识 AI Agent》

归档

  • 2026 年 9 月 (4)
  • 2025 年 8 月 (1)
  • 2025 年 7 月 (1)
  • 2025 年 6 月 (10)
  • 2025 年 5 月 (10)
  • 2025 年 4 月 (5)
  • 2025 年 2 月 (1)
  • 2024 年 12 月 (4)
  • 2024 年 11 月 (7)
  • 2024 年 9 月 (1)
  • 2024 年 8 月 (4)
  • 2024 年 7 月 (1)
  • 2024 年 2 月 (1)
  • 2023 年 12 月 (3)
  • 2023 年 11 月 (6)
  • 2023 年 10 月 (4)
  • 2023 年 9 月 (2)
  • 2023 年 8 月 (38)
  • 2022 年 2 月 (1)
  • 2022 年 1 月 (13)
  • 2021 年 1 月 (1)
  • 2020 年 10 月 (1)
  • 2020 年 1 月 (1)
  • 2014 年 7 月 (2)

分类

  • IT咨询 (5)
    • IT咨询框架 (3)
  • IT项目管理 (2)
  • 人工智能 (12)
    • AI概念和理论 (1)
    • 人工智能应用 (2)
    • 数据科学 (3)
  • 企业架构 (8)
    • AI应用架构设计 (3)
    • 传统应用架构设计 (2)
  • 工具Tips (3)
  • 技术教程 (3)
  • 生活笔记 (23)
  • 编程基础 (3)
    • 计算机网络 (2)
  • 编程笔记 (56)
    • .NET技术栈 (3)
    • C语言编程 (1)
    • Golang技术栈 (1)
    • iOS App开发 (1)
    • Python编程 (18)
    • UE虚幻引擎 (1)
    • Unity游戏开发 (9)
    • Wordpress (5)
    • 工具 (1)
  • 行业动态 (16)
©2026 编程开物 | WordPress Theme by SuperbThemes | 沪ICP备17019044号-3