厌倦了手动检查追踪记录?了解智能体自动问题检测功能
可观测性已成为生产环境中 AI 智能体的标配。但仅仅记录日志、指标和追踪记录并不能改善用户体验。您需要根据这些数据采取行动。
问题在于,从海量的追踪记录中寻找可操作的洞察,无异于大海捞针。面对成千上万条生产日志,您如何发现用户感到沮丧或中途放弃的对话?您如何捕捉那些以高置信度自信满满地给出错误答案并误导用户的智能体?手动逐一审查追踪记录是无法扩展的。
今天,我们宣布在 MLflow 中推出自动化问题检测(Automatic Issue Detection)。作为一项全新的 AI 驱动洞察功能,它将数小时的手动检查和分类工作简化为只需 3 次点击即可完成。
为什么您需要自动化问题检测?
随着 LLM 应用程序在生产环境中的增长,维护智能体质量变得越来越具有挑战性。随着流量的扩展,以下四个问题愈发突出:
- 手动审查无法扩展:随着请求量的增加,逐一检查单条追踪记录是不可持续的。
- 标准不明确:如果没有预定义的基准作为起点,很难知道应该衡量哪些质量维度。
- 故障模式分散:相关的故障散布在成千上万条记录中,缺乏系统性的归类,导致反复出现的问题容易被遗漏。
- 缺乏结构化追踪:如果没有正式的问题管理机制,发现的问题只会消失在笔记和 Slack 讨论串中,导致回归问题无法被察觉。
自动化问题检测将团队从被动的手动调试转变为主动、系统性的质量识别。
入门
问题检测功能内置于 MLflow UI 中,可直接针对您已经采集的追踪记录运行。

工作原理
CLEARS 框架
MLflow 围绕六个质量维度组织问题检测,形成了 CLEARS 框架(Correctness 正确性、Latency 延迟、Execution 执行、Adherence 合规性、Relevance 相关性、Safety 安全性)。您可以根据应用需求选择重点关注的类别。

您可以选择哪些 CLEARS 类别对您的用例至关重要。例如,客户支持机器人可能优先考虑“合规性”和“安全性”;而代码助手则最关注“正确性”和“执行”。
检测流程
一旦开始分析任务,MLflow 将:
- 采样并分析:使用您选择的 LLM(通过 MLflow AI Gateway 或直接 API 连接)分析追踪记录
- 聚类:对相关问题进行聚类,让您看到的不再是杂乱的个体失败列表,而是问题模式
- 标注:在原始追踪记录中添加特定发现,以便您能直接查看证据
- 生成摘要:汇总关键发现、严重程度分布及推荐的后续步骤
该分析过程异步运行,并提供实时进度跟踪,因此您可以启动任务后稍后再查看结果。

问题分类(Triage)
检测到的问题并非“发完即忘”的警报。每个问题都可以经历结构化的生命周期:
- 待处理 (Pending) — 新发现的问题,需要审查
- 已解决 (Resolved) — 修复已部署并经验证
- 已拒绝 (Rejected) — 经调查确定非真实问题
![]()
随着团队了解的深入,您还可以编辑问题描述并调整严重程度评级。这为您提供了应用质量历史的动态记录,而不仅仅是一个静态快照。
总结
自动化问题检测现已在 MLflow 3.11.1+ 中作为 MLflow AI Insights 的一部分提供。入门步骤如下:
- 追踪:使用 MLflow 追踪您的 LLM 应用程序,以收集问题检测所需的数据。
- 检测问题:选择您的 CLEARS 类别,并针对追踪记录运行分析。
- 分类并解决:通过结构化的问题生命周期(待处理、已解决或已拒绝)管理发现的问题。
如果您觉得有帮助,请在 GitHub 上为我们点个星:github.com/mlflow/mlflow ⭐️
