Anthropic 是闭源模型厂商中最早认识到编程是token变现核心场景的公司。大模型的主要付费用户是开发者和企业技术团队,他们对价格不敏感,更看重模型的编码效率和质量。掌握编程这一商业场景的先机,就可以实现token溢价。因此Anthropic在研发上专注编程。在确立编程能力优势后,自2024年初推出 Claude 3 系列起,在业内率先采用旗舰-中端-轻量的立体产品组合,实现同代模型分层定价,同时抢占高端和大众市场。
GPT 5.5 的定价($5/$30)与Opus 4.7/4.8($5/$25)看齐,建立与 Claude Opus 同等的高端价格锚点,次级模型GPT 5.4 mini ($0.75/$4.50)和nano ($0.20/$1.25),大幅低于同级 Claude Haiku 4.5 ($1.00/$5.00),以价格换市场。
Google 是安卓生态体系的核心,已经有完整的商业闭环,需要处理的关系更为复杂,动作也更谨慎。Gemini 需同时服务于 Google Cloud 的企业客户、Workspace 的生产力用户、以及搜索产品的消费者体验。即便意识到编程的重要性,也无法决然将资源全部聚焦于编程和办公,还是要走多模态、多元化路线。Google也是紧随Anthropic从1.5代 Gemini开始将产品分为旗舰Pro系列和轻量Flash系列,但产品迭代速度相对较慢,价格定位更低。
产生这一现象的根本原因是经济型token消费量的爆炸式增长。大多数日常编码任务、文档处理和自动化流程并不需要 Opus 或 GPT-5.5 级别的能力,而是由 Sonnet、mini、Flash 等模型承担,或交由开源/半开源模型完成。随着 AI 编码助手、Agent 工作流和企业级 AI 应用的普及,这些次级/轻量-开源/半开源模型的调用量激增,远超旗舰模型。
token越来越贵固然伤及荷包,更让人心疼的是不少token在调用智能体(Agent)干活时被系统性地浪费掉了。上下文陷阱(Context Trap)、分词器黑箱(Tokenizer Black Box)、技能冗余(Skill Redundancy)、以及多Agent协同中的沟通税与长程熵增(Communication Tax and Entropy Drift),这些结构性的跑冒滴漏叠加在一起,构成了token不经济的内部技术根源。
而Agent架构天然放大长文本陷阱。智能体会将问题拆解,规划调用工具,读文件,检查反馈,修改方案,再调用工具,循环往复,每一步都可能把历史记录重新带进上下文。同一批信息被反复读取,同一个任务被反复计费。Salim et al.,(2026)对ChatDev框架的分析发现,代码审查阶段(Code Review)消耗的token平均占总消耗的39.5%,是所有开发阶段中最高的4,这意味着近四成的token花费在了Agent之间反复传递已有信息的过程中,而非真正生成新内容。
图3:对ChatDev框架30个任务中各阶段Token消耗占比的分析 Salim, et al., (2026). Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering. Proceedings of the Mining Software Repositories Conference (MSR).
技能(Skill)是让Agent架构更专业的关键工具之一。有人把技能看成是长一点的markdown,有人把技能当成一个装了各类参考文献和操作说明的文件夹,也有人把技能理解为一段超长的结构化prompt。在实际的推理和Agent任务中,很多技能过长过杂,加大了token消耗。Gao et al.,(2026)对55,315个公开技能的大规模实证研究揭示了技能的无效加载是如何浪费token的5。在路由层面(即Agent决定是否调用某个技能的环节),高达26.4%的技能完全没有路由描述,像一本本没有目录的工具手册,大大增加被Agent无效加载的概率。在正文层面,超过60%的技能内容不是可直接执行的操作规则,而是背景解释或示例文本,使用技能的大部分token花在了阅读说明书而非干活上。更严重的是,部分技能会密集引用文件,单次调用就会注入数万乃至十余万token,其中可能只有很小比例与当前任务相关。Han et al.,(2026)的SWE-Skills-Bench基准测试进一步证实了技能效用的有限性6。该研究在真实GitHub项目上测试了49个公开软件工程技能,结果显示39个技能(79.6%)没有带来通过率的任何提升(有技能和无技能的Pass率相同),全部49个技能的平均效用增量仅为可怜的1.2个百分点,然而token开销最高增加了451%。仅有在编码特定领域专业知识的7个技能(如金融风控公式、云原生流量管理、GitLab CI模式)带来了有意义的性能提升(最高提升30个百分点);更有3个技能因版本冲突导致性能下降(最高下降10个百分点)。这说明技能的效用高度依赖场景匹配度,盲目调用只会徒增成本。(
四)多Agent的废话与长任务的跑偏
多Agent是目前受青睐的工作方式,让使用者一个人领导一个由AI构成的团队,写代码的、审查的、测试的、修复的,多个Agent各司其职,互相监督,在很多情况下确实提高了输出质量。但机器之间也会开无效会议,对话中不断重复已经讨论过的任务背景、之前的结论、格式化套话,每重复一次,就再消耗一遍token,Salim et al.,(2026)称之为多Agent系统的沟通税(communication tax)4。此外,将复杂的长程任务(long task)交由多Agent系统完成,正在成为编程和办公的主流做法,并逐渐扩展到餐饮、出行等日常生活的场景。长程任务本身就存在容易跑偏的问题。此类任务的上下文里塞满工具输出、报错、草稿、日志,很容易造成模型推理逐渐偏离目标。为了纠偏,开发者往往会要增加摘要、记忆、检查、回滚等机制,带来更多token消耗。Luo et al.,(2026)在对TabTracer研究中观察到,传统链式推理在路径过长时容易陷入循环状态,对抗性注入可以故意触发这种循环,使Agent在错误路径上反复消耗token而不自知7。这种维持稳定所需的额外消耗通常被称为熵税(entropy tax),系统越复杂,Agent越自由,越需要监督,任务越长,上下文越大,熵税增长越快。一个看似高效的Agent团队,token账单中可能有超过一半花在了内部协调与自我纠偏上。上下文陷阱、分词器黑箱、技能的无意义调用、废话文学和长任务跑偏,这些因素叠加在一起,对token消耗的效果不是简单的加和,而是乘积性的指数增长。
(It is comparatively easy to make computers exhibit adult-level performance on intelligence tests or playing checkers, and difficult or impossible to give them the skills of a one-year-old when it comes to perception and mobility),接近四十年后的今天,这句话的含金量仍在上升23 。
李飞飞在长文《From Words to Worlds》中,把空间智能与具身智能列为需要更长时间才能成熟的中期目标8。原因在于,现实世界没有编译器,物理世界不接受迭代,只接受验证,而验证的成本永远比生成的成本高。曾被寄予厚望的仿真技术虽然起到一定效果,但要实现类似Agent自适应在编程场景中的效能,还有很长的路要走。仿真技术是为绕开物理世界没有编译器的难题,用数字孪生和物理引擎搭一个虚拟验证空间。但具身智能发展还是撞上了虚拟与现实鸿沟(Sim-to-Real Gap),在简化沙盒里靠海量Token练出的最优控制轨迹,一碰上真实世界的摩擦、材料疲劳和环境噪声,立刻变得极其脆弱。Aljalbout et al.,(2025)认为仿真到现实的差距并非单一问题,而是由动力学差异、感知失真、执行器非线性、系统设计缺陷等多个子差距叠加而成,完美仿真器在计算上不可行20。
Token消耗催生的算力扩张,算力中心对水、电等资源极度饥渴,往往在短期内制造出巨大的供给缺口,对所在地的民生用水用电产生挤压效应。美国弗吉尼亚州北部的数据中心巷(Data Center Alley)集中了全球密度最高的数据中心集群,承载了约70%的全球互联网流量。由于地方电网容量被科技公司用长期趸售协议提前锁定,居民和传统商业的能源配额被严重压缩。
技能优化与减法思维。Gao et al.,(2026)的SkillReducer研究提供了技能优化的两条路径。一是描述压缩,为缺少路由描述的技能补充精简信息,压缩冗余的背景解释和示例;二是渐进式加载,不一次性把完整技能塞入上下文,而是按需加载,可实现39%的技能体压缩5。两者叠加后,在大幅压减技能调用的token消耗的同时,模型功能质量反而提升2.8%。从中可以看出,Agent技能调用不是越多越好,必要时做减法的收益要远大于做加法。减少上下文中的无效信息,不仅可以降低token消耗,还能提升模型输出的准确性。Less is more在此处不仅符合代码之美,也让token更经济。
多Agent预算硬约束与主持人架构。没有分工、预算上限和明确停止条件的多Agent系统,演变成马拉松式的茶话会的概率大大增加。解决的路径是在多智能体协同网络中设计具备硬性预算约束(Hard Budget Constraints)与异步仲裁机制的主持人架构。Luo et al.,(2026)提出的蒙特卡洛树搜索方法,在多智能体流程中加入中间步骤的工具验证,保存候选状态,必要时回滚。可以将这种思路从推理层面提升到架构层面,为每个子任务设定token预算上限,由主持人Agent监控全局消耗,在预算耗尽前强制终止无效循环7。这不仅能防止财务失控,往往也会同时提升系统的整体效率。