你的AI在想什么

上个月,一个朋友的公司上线了一个 AI 客服助手。上线第一周,用户满意度从 72% 飙升到 89%。所有人都觉得这是一次成功的技术落地。

第二周,满意度掉到了 61%。

没人知道为什么。日志里没有任何报错,API 响应时间正常,模型推理延迟也没变。客服主管说"AI 开始胡说了",但没人能说清楚它从什么时候开始胡说、为什么胡说、胡说频率有多高。

这不是一个孤例。我最近跟好几个团队聊过,发现一个共同的痛点:AI Agent 跑起来之后,团队对系统的理解能力反而在下降。

传统监控的三个假设,全被 AI 打破了

过去十几年,可观测性领域建立了三大支柱:日志(Logs)、指标(Metrics)、链路追踪(Traces)。这套体系运转得非常好,但它建立在三个隐含假设之上。

第一个假设:系统的行为是确定性的。 给定相同的输入,系统会产生相同的输出。你可以通过阅读代码来理解系统的行为边界。但 AI Agent 不是这样。同样的用户问题,Agent 可能给出完全不同的回答,取决于上下文窗口的状态、之前的对话历史、甚至 prompt 里某个词的微妙变化。代码审计?你审的只是调用框架,真正的决策逻辑在模型的权重里,而那个黑箱你是看不到的。

第二个假设:错误是可枚举的。 传统系统里,你可以通过穷举来覆盖异常路径——空指针、超时、权限不足、数据缺失。每种异常都有对应的错误码和处理逻辑。但 AI 的"错误"不是这种类型。它可能给你一个语法完美、逻辑自洽、但事实上完全错误的回答。从系统的角度看,没有任何异常被触发。HTTP 200,响应体完整,schema 校验通过。只是答案是错的。

第三个假设:链路是可以追踪的。 在微服务架构里,一个请求从网关到 A 服务到 B 服务到数据库,每一步都有 trace ID 串联。你可以画出完整的调用链,定位瓶颈。但 AI Agent 的"调用链"不在基础设施层面。它在思维层面:先理解用户意图,再决定调用哪个工具,再判断结果是否充分,再决定是否需要追问。这个思维过程,传统 APM 工具完全看不到。

AI 可观测性的核心不是"系统跑得怎么样",而是"系统在做什么"

这就是我认为大部分团队搞错的地方。他们在 AI 系统上线后,继续用传统的监控手段——看延迟、看错误率、看 QPS。这些指标当然重要,但它们回答的是"系统健康吗"这个问题,而不是"系统在做正确的事吗"。

AI 可观测性需要回答的是完全不同的问题:

Agent 在这个请求里,做了哪些决策?它为什么选择了工具 A 而不是工具 B?它消费了多少 token 的上下文?它的推理路径是什么?它的回答和预期答案之间的偏差有多大?

这些问题听起来很抽象,但在生产环境里,它们是决定你的 AI 系统是"锦上添花"还是"定时炸弹"的关键。

三个正在成型的实践方向

我观察到一些团队开始尝试的方法,不一定成熟,但方向值得参考。

1. Agent 思维链的结构化记录

不是记录日志,是记录"思考过程"。每次 Agent 做出决策,把它的推理链(chain-of-thought)、工具调用的选择理由、中间结果和最终输出,全部以结构化格式存储下来。这不是传统的 application log,而是一种新的数据类型——我姑且叫它"决策日志"(Decision Log)。

有了决策日志,你可以在事后回放任何一个 Agent 的完整思考过程,而不是只看到输入和输出。这对于定位"AI 为什么犯了这个错"至关重要。

2. 基于评估的实时监控

传统监控靠阈值告警。AI 系统需要的是"质量评估"。一些团队开始引入轻量级的评估模型(eval model),对 Agent 的输出做实时打分。不需要复杂的 benchmark,一个简单的二分类器——"这个回答是否合理"——就能在质量断崖式下降时及时告警。

上面提到的那个 AI 客服案例,如果他们有这个机制,第二周的满意度暴跌不会等两天才被发现。

3. 成本归因到决策粒度

AI 系统的成本和传统系统不同。传统系统的成本主要是计算资源和带宽,按请求计费。AI 系统的成本主要是 token 消耗和模型推理时间,而这些消耗的差异可以非常大——一个简单的查询可能因为 Agent 陷入"思考循环"而消耗掉正常请求 50 倍的 token。

我见过一个案例,某个 Agent 在一次对话中调用了 23 次外部 API,每次都在修正上一次的错误结果,最终生成了一个看起来还不错的回答。用户满意了,但这一次对话的成本是平均水平的 80 倍。如果没有决策粒度的成本归因,这种异常永远不会被发现。

这件事为什么现在就要做

一个不太舒服的观察:大部分团队在 AI Agent 上线之后,对系统行为的理解程度是随着时间递减的。刚上线时,大家盯得紧,prompt 调过几轮,效果验收过,心里有数。三个月后,没人再关注了。半年后,Agent 已经积累了大量的行为数据,但没有任何人——包括最初搭建系统的工程师——能准确说出"我们的 AI 到底在什么条件下会出错"。

这不是技术问题,是认知问题。传统软件的行为边界是代码定义的,工程师读过代码就知道边界在哪。AI 系统的行为边界是统计性的,它没有硬编码的边界,只有在运行中才能逐渐显现。

如果你不建立观测机制,你就永远在盲人摸象。

回到开头那个故事。后来那个朋友团队加了一套简单的 Agent 决策日志和每日质量抽样评估。第三周,满意度回升到了 85%。不是因为 AI 变聪明了,而是因为他们终于能看到 AI 在犯什么错,然后针对性地调整 prompt 和工具调用策略。

看得见,才能管得住。这个朴素的道理,在 AI 时代反而被很多人忘了。

You voted 3. Total votes: 22

添加新评论