AI Agent 一天烧掉 1.4 万美元,你的风控系统还在睡大觉

博客分类: 

上周看到一个案例,震得我好一阵没缓过来。

一家三个人的小公司,AWS 月费常年维持在十几美元的水平。某天早上,创始人打开邮箱,发现一封来自 AWS 的账单提醒——单日费用 1.4 万美元。不是月度,是单日。

排查的结果更让人窒息:一个 EC2 实例上的静态密钥不知道什么时候泄露了,攻击者拿着这个密钥大量调用 Bedrock 的 Claude 模型,跑了一整夜的推理任务。从安全角度看,这甚至不算什么高级攻击,就是一个最基础的凭证扫描 + 资源滥用。但从财务角度看,一家月支出十几美元的公司,在一夜之间欠下了一笔可能需要半年才能消化的债务。

这个案例之所以让我印象深刻,是因为它揭示了一个在 AI Agent 时代正在加速放大的系统性风险:算力消耗的速度,已经远远超过了传统风控系统的反应速度。

传统账单风控的三道防线,全部失灵

大多数公司的云成本风控,本质上就三道防线:

第一道:预算告警。 设置一个月度预算阈值,超过 80% 发邮件提醒。问题是,AI 算力的消耗速度是指数级的。一个大模型推理任务可能在几分钟内就烧掉几百美元,而告警系统的检测周期通常是小时级甚至天级的。等告警邮件送达,预算早就被打穿了。

第二道:用量配额。 给每个服务设置调用次数或并发数上限。但 AI Agent 的行为模式跟传统服务完全不同——Agent 是自治的,它会根据任务需要自主决定调用链路的深度和广度。一个看似简单的任务,Agent 可能会递归调用十几个工具,每个工具又触发多次模型推理。你用传统 QPS 限制来约束一个 Agent?它可能在合规范围内就把你的钱花光了。

第三道:事后审计。 月底看账单,分析哪些服务花了多少钱。这在传统架构下是够用的,因为成本曲线是平滑的。但在 AI Agent 场景下,成本曲线可能是一根垂直向上的针——等你月底看到的时候,该哭的已经哭完了。

Agent 不是 API 调用,它是"花钱决策者"

这里有一个认知上的关键转变:当你把 Agent 部署到生产环境的那一刻,你实际上是把花钱的决策权交给了一个 AI 模型。

想想看,传统的服务调用是确定性的——你写好代码,调用几次 API,每次的成本是可预测的。但 Agent 不同,它是概率性的、自治的。你给它一个任务,它自己决定要调用哪些工具、要推理多少轮、要消耗多少 Token。同一个任务,不同的 Agent 实现,成本差异可能是 100 倍。

更可怕的是,Agent 的行为是上下文敏感的。一个本来只需要 3 轮推理就能完成的简单任务,如果因为某个工具的返回结果不理想,Agent 可能会进入重试循环——不是死循环,而是那种看起来很合理的"让我再试一次"循环,每试一次就是一轮完整的模型推理,每轮推理都在烧钱。

我见过一个内部案例:一个 Agent 在处理文档摘要任务时,因为源文档格式不标准,Agent 自主决定先做格式转换、再做内容清洗、再做摘要、再做质量检查——四轮完整调用,成本是预期的 8 倍。每一轮单独看都"合理",但合在一起就是一次成本失控。

构建 Agent 时代的算力风控

既然传统三道防线都不管用了,那该怎么办?我的思路是把风控嵌入到 Agent 的执行链路里,而不是放在外围。

第一层:Agent 级别的预算硬限制。 每个 Agent 实例在启动时,必须绑定一个"算力预算"。这个预算不是月度预算,是单次任务的预算上限。Agent 在执行过程中,每一步推理前都要检查已消耗算力,一旦接近阈值,强制终止并返回已完成的部分结果。这不是软告警,是硬熔断。

第二层:Token 级别的实时计量。 传统的用量计量是"API 调用次数",但 Agent 的成本主要在 Token 消耗。计量系统需要下沉到 Token 级别,实时追踪每次推理的输入 Token 和输出 Token,而不是等月底看总账。一旦某个 Agent 的 Token 消耗速率异常(比如短时间内出现大量重试),立即触发熔断。

第三层:Agent 行为审计。 记录 Agent 的完整决策链路——调用了哪些工具、每个工具触发了多少轮推理、每轮的 Token 消耗是多少。这不仅是成本归因的需要,更是安全审计的需要。那个 1.4 万美元的案例里,如果攻击者调用的是一个有完整行为审计的 Agent 系统,异常行为应该在第一轮就被检测到。

第四层:密钥的短生命周期管理。 回到那个案例的根因——静态密钥泄露。在 Agent 场景下,密钥管理的重要性被放大了 10 倍,因为泄露的不只是计算资源,还有模型调用的能力。所有 Agent 使用的凭证都应该是短生命周期的,配合自动轮换机制。即使泄露,攻击窗口也被压缩到最小。

写在最后

AI Agent 正在从 Demo 走向生产环境,从玩具变成工具。但我们的基础设施治理思路,还停留在"可控的 API 调用"时代。

那家三人公司的遭遇不是个案,它只是冰山一角。随着越来越多的团队把 Agent 接入生产系统,算力失控的案例会越来越多,金额会越来越大。

这不是在否定 Agent 的价值。恰恰相反,Agent 的能力越强,我们越需要给它套上成本风控的缰绳。一匹好马,配上好缰绳,才能跑得又快又稳。

没有缰绳的马,不是自由,是失控。

You voted 2. Total votes: 20

添加新评论