面向 LLM 和智能体的 AI 监控

AI 监控是指对生产环境中运行的 AI 应用的质量、性能、成本和安全性进行持续评估的实践。LLM 监控侧重于单个模型调用,跟踪输出质量、幻觉、Token 成本和延迟;而智能体(Agent)监控则将其扩展到多步推理、工具选择和任务完成情况。两者都超越了正常运行时间和错误率的范畴,旨在评估非确定性输出的质量,并检测行为偏离预期标准的情况。 生产链路追踪(Production tracing) 捕获了实现上述目标所需的执行数据。

与传统的 ML 监控(在结构化数据上跟踪特征分布和预测准确性)不同,AI 监控必须评估自由形式的语言输出、多步智能体推理、工具调用链、检索准确性和 Token 成本。传统的监控只能告诉你系统是否在运行;而 AI 监控能告诉你系统是否运行良好

MLflow 提供了一套完整的 AI 监控堆栈:利用 LLM 评测器进行异步评分的自动在线评估、用于成本控制的可配置链路采样、用于调试的用户和会话上下文跟踪、人工反馈收集,以及用于幻觉检测、安全性评估等的内置评分器。 探索评估与监控文档.

为什么 AI 监控很重要

生产环境中的智能体和 LLM 应用面临着开发过程中不存在的挑战

质量漂移检测

问题:由于模型更新、提示词(Prompt)变更或用户输入的变化,智能体的输出质量会无声无息地下降。

解决方案:持续的 LLM 评测器和人工反馈可以在用户失去信任之前检测出质量回归。

成本与延迟控制

问题:如果没有针对每次请求的支出和响应时间的可见性,Token 成本和延迟可能会失控。

解决方案:带有各模型详细分类和异常检测的自动成本/Token 跟踪。

安全与保障

问题:生产环境中的智能体面临着开发阶段不存在的提示词注入、PII 泄露、越狱攻击和策略违规等问题。

解决方案:对每次请求进行基于确定性和 LLM 的实时安全评分。

生产调试

问题:当质量下降或错误激增时,跨多步智能体工作流追踪根本原因非常复杂。

解决方案:带有评估分数的完整执行链路,能够实现快速的根本原因分析。

AI 监控的应用场景

  • RAG 系统中的幻觉检测:在生产链路中运行扎根性(groundedness)评分器,以捕获检索质量下降或模型开始生成检索上下文中不支持的声明的情况。
  • 智能体工具选择监控:跟踪智能体是否选择了正确的工具并高效完成任务。检测循环、不必要的重试以及浪费 Token 并降低用户体验的错误工具选择。
  • 成本优化:识别昂贵的查询,跟踪各模型的支出趋势,并寻找在不牺牲质量的前提下,针对低复杂度请求切换到更便宜模型的方法。
  • 安全回归检测:在模型或提示词更新后,将安全分数与部署前的基准进行比较,在影响大规模用户之前捕获回归问题。
  • 提示词变更的 A/B 测试:使用生产链路数据比较不同提示词版本的质量分数、延迟和成本,从而做出基于数据的决策,确定保留哪个版本。
  • 受监管行业的合规与审计 医疗、金融和法律团队需要证明其 AI 系统行为正确且安全。AI 监控为每次输入、输出和模型交互提供完整的审计跟踪,以供监管审查。
  • 延迟 SLA 监控:针对用户直接交互的聊天机器人、编程助手和实时智能体,响应时间直接影响用户体验。跟踪 p50/p95/p99 延迟和首字延迟(Time-to-First-Token),在影响留存率之前捕获性能回归。

如何实施 AI 监控

MLflow 提供了一套开源的 AI 监控堆栈,涵盖链路追踪、利用 LLM 评测器进行的自动质量评估、成本和 Token 跟踪、人工反馈收集以及实时安全护栏,且兼容任何 LLM 提供商和任何智能体框架。以下是设置方法。

1
追踪每次请求
使用以下代码添加生产链路追踪: @mlflow.trace 以捕获执行图。并附加用户、会话和部署上下文。
2
自动评分链路
设置 自动 LLM 评测器评估 在后台对生产链路进行安全性、准确性和质量漂移的评分。
3
收集人工反馈
使用 mlflow.log_feedback() 记录与链路关联的用户评分。捕获自动评测器遗漏的质量问题,并随时间校准评分。
4
跟踪成本与
实施护栏
集成自动 Token 和成本跟踪 按请求进行跟踪。 AI 网关 添加实时安全护栏。

通过上下文追踪生产请求

python
import mlflow
import os
from fastapi import FastAPI, Request
from pydantic import BaseModel
app = FastAPI()
class ChatRequest(BaseModel):
message: str
@app.post("/chat")
@mlflow.trace
def handle_chat(request: Request, chat_request: ChatRequest):
# Attach production context to every trace
mlflow.update_current_trace(
client_request_id=request.headers.get("X-Request-ID"),
tags={
"mlflow.trace.session": request.headers.get("X-Session-ID"),
"mlflow.trace.user": request.headers.get("X-User-ID"),
"environment": "production",
"app_version": os.getenv("APP_VERSION", "1.0.0"),
"deployment_id": os.getenv("DEPLOYMENT_ID", "unknown"),
},
)
response = generate_response(chat_request.message)
return {"response": response}

注册评测器进行自动在线评估

收集关于链路的用户反馈

python
import mlflow
from mlflow.entities import AssessmentSource
from fastapi import FastAPI
app = FastAPI()
@app.post("/feedback")
def submit_feedback(trace_id: str, is_correct: bool, user_id: str):
mlflow.log_feedback(
trace_id=trace_id,
name="response_is_correct",
value=is_correct,
source=AssessmentSource(
source_type="HUMAN",
source_id=user_id,
),
)

MLflow 是最大的开源 面向智能体、LLM 和 ML 模型的 AI 工程平台,每月下载量超过 3000 万次。成千上万个组织使用 MLflow 来调试、评估、监控和优化生产级 AI 智能体和 LLM 应用,同时控制成本并管理模型和数据的访问。MLflow 由 Linux 基金会支持并以 Apache 2.0 许可证发布,提供了一套无厂商锁定的完整 AI 监控解决方案。 立即开始 →

开源 vs. 专有 AI 监控工具

在为智能体和 LLM 应用选择 AI 监控平台时,开源与专有 SaaS 工具之间的决策对您的团队、基础设施和数据所有权具有重大的长期影响。

开源 (MLflow) 使用 MLflow,您可以保持对生产链路和监控数据的完全控制。可以将其部署在自己的基础设施上,或使用 Databricks、AWS 或其他平台上的托管版本。没有按链路收费,没有使用限制,也没有厂商锁定。您的生产数据始终处于您的控制之下,并且 OpenTelemetry 的兼容性确保您可以将链路导出到任何后端。

专有 SaaS 工具:商业监控平台提供了便利,但牺牲了灵活性和控制权。它们通常按链路或按席位收费,这在大规模使用时会变得昂贵。您的生产数据会被发送到它们的服务器,这引起了敏感链路的隐私和合规性问题。您会被锁定在它们的生态系统中,导致难以更换供应商或自定义功能。

团队为何选择开源:运行生产级智能体的组织越来越多地选择 MLflow,因为它提供了企业级的监控,同时在数据主权、成本可预测性或灵活性方面毫不妥协。Apache 2.0 许可证和 Linux 基金会的支持确保 MLflow 保持真正的开放和社区驱动,而不受单一供应商控制。

常见问题 (FAQ)

AI 监控是持续评估生产环境中 AI 应用(包括 LLM 和基于智能体的系统)的质量、性能、成本和安全性的实践。与传统软件监控(正常运行时间、错误率)不同,AI 监控必须评估非确定性文本输出的质量、跟踪 Token 成本、检测幻觉,并识别模型行为何时偏离了预期标准。

相关资源