单价降了,账单涨了

AI成本账单

上周看到Gartner的一条预测:到2028年,至少50%的GenAI项目将超出预算。几乎是同一时间,a16z发布了他们的第七版《State of Markets》报告,里面有个数据——AI Agent的token消耗量大约是人类的5倍,半年增长了14倍。

这两条消息放在一起看,我觉得超预算的比例可能还保守了。

不是模型变贵了。过去一年,主流模型的API单价一直在降。问题出在"算账"这件事本身——大部分组织在AI投入上的成本模型,从一开始就是错的。

一笔算不清的账

我见过一个团队做AI客服项目的预算评估。最初按"每工单平均3轮对话 × 预估日工单量 × 单次token成本"来算,每人每天大概2块钱的API费用。看起来不贵,立项了。

上线两个月后实际账单是预估的3.5倍。不是流量超预期——日工单量甚至比预估少了10%。多出来的钱花在了三个完全没预料到的地方:prompt每次迭代要重跑全量测试样本,这块token成本没人计入预算;Agent遇到复杂问题会自主拆成多步执行,一次对话的token消耗是人工对话的3到8倍;为了做质量评估(eval),每周要跑一轮全量评估集,一次eval的成本比一周线上流量还贵。

这不是个例。a16z报告里有个更宏观的数据:头部AI产品的重度用户月均花费超过900美元,而中位数用户只要25美元。36倍的差距意味着,用"人均成本"来做预算基本上是在猜——而且大概率猜错。

杰文斯又来了

a16z这份报告里提到了一个19世纪经济学家的名字——杰文斯(William Stanley Jevons)。1865年他发现,蒸汽机效率提高并没有减少煤炭消耗,反而因为蒸汽机变得更经济,更多行业开始使用它,导致总耗煤量激增。

AI的token市场正在重复这个规律。

模型单价在降,但更便宜的智能让Agent在经济上变得可行,新的应用场景不断涌现。结果是token总消耗量呈抛物线式攀升。有个细节很说明问题:英伟达的A100芯片已经服役好几年了,但租赁价格到现在仍与年初持平甚至更高——效率提升省下来的钱,被暴增的需求吃掉了。

具体到团队层面,这个效应更明显。我认识一个做内部知识库问答的项目,最初评估成本时按"每人每天问5个问题"来算。上线后发现人均提问量是12个——因为回答速度快、体验好,大家把原来自己查文档、问同事的问题全扔给了AI。更意外的是,有同事开始用它做代码review的辅助,一个review下来要十几轮对话,token消耗是普通问答的6倍。没人要求他这么用,但工具好用了,用法就自然生长出来了。

传统软件的成本模型是"用户数 × 单用户资源消耗",其中单用户消耗基本稳定。AI系统的单用户消耗取决于用户和模型交互的深度,而交互深度是会随着体验改善而暴增的。

四个成本黑洞

大部分团队只盯着API调用费用,觉得那就是AI的全部成本。实际上,API费用通常只占AI系统总成本的30%左右。剩下的70%藏在四个地方:

prompt工程的隐性成本。一个生产可用的prompt,从"能跑"到"稳定好用",通常需要20到50轮迭代。每轮迭代要跑测试样本验证效果,这些token消耗没人记账。我了解过一个金融场景的合规审核Agent,光prompt调优阶段就烧掉了超过4万块——这笔钱分散在十几个工程师各自的实验账号里,直到财务拉了汇总报表才被发现。

eval测试成本。做AI系统的人都知道eval不是一次性的。每次模型升级、prompt改动、业务规则变更,都得重跑评估集。如果评估集有几千条样本,每条要跑完整的推理链路,一次eval的成本可能相当于线上一周的流量。更麻烦的是,随着系统复杂度增加,eval样本量也在膨胀——你加的边界case越多,下次eval就越贵。

Agent的不可预测行为。确定性系统里,输入A永远输出B,成本可预测。Agent不是这样。它可能在某些case下走进循环,可能调用了你没预期的工具,可能为了"确认"一个结果反复验证。我们测过一个文档分类的Agent,正常case下一个文档处理约12000个token,但遇到格式复杂的PDF,它会反复提取和验证,最高一次跑了85000个token——正常case的7倍。这种异常case虽然只占3%左右,但累积起来的成本占比远超3%。

多Agent级联。一个Agent调用另一个Agent,每个Agent都带着完整上下文。三个Agent协作一次的成本,不是单Agent的3倍,可能是8到15倍——因为每层调用都在传递和扩展上下文。传统软件里组件调用的边际成本接近于零,AI系统里每多一个Agent参与者,上下文传递的token开销是非线性增长的。

该换一种算账方式了

Gartner说的"50%超预算",背后的原因不是价格问题,是认知问题。大部分组织还在用"固定月费 + 可变费用"的传统软件预算模型来套AI项目。这个模型假设资源消耗是可预测且稳定的,但AI系统的资源消耗取决于模型和用户怎么交互——用户行为一变,成本就变。

传统软件的成本上限在架构设计阶段就基本锁定了:数据库多大、服务器几台、并发量多少,评审完就有数了。AI系统的成本上限是开放的,上线后完全可能因为用户发现了一种新用法,调用量翻十倍。a16z的报告也印证了这一点:标普500中近30%的公司报告AI产生了可量化影响,但只有约2%在追踪实际的AI相关指标。也就是说,98%的公司对自己的AI投入效果是一笔糊涂账。

我自己也在摸索怎么做AI项目的成本建模。目前觉得比较靠谱的框架是把成本分三层:可预测的基础成本(模型推理的固定开销),随业务增长但可建模的弹性成本(跟用户量、交互深度挂钩的部分),以及不可预测的探索成本(prompt实验、eval迭代、Agent异常行为)。对每层用不同的预算策略——基础成本走正常运维预算,弹性成本设阈值预警,探索成本设硬性上限并定期复盘。

有个朋友在一家中型SaaS公司做技术负责人,他们给每个AI功能都建了一个成本看板,产品经理和工程师能实时看到每个功能的日均token消耗和成本趋势。透明的副作用很有意思:产品决策开始主动考虑成本维度——某个功能日成本超过阈值时,产品团队会主动讨论是不是每次都需要调最强的模型,还是可以用轻量模型加规则兜底。这比我见过的任何财务审批流程都有效。

不过话说回来,这种透明也可能带来过度保守——看到每次调用都在花钱,会不会因此放弃一些本来能带来更大价值的AI用法?这个问题我自己也还在想。

You voted 1. Total votes: 1

添加新评论