AI 监控是指对生产环境中运行的 AI 应用的质量、性能、成本和安全性进行持续评估的实践。LLM 监控侧重于单个模型调用,跟踪输出质量、幻觉、Token 成本和延迟;而智能体(Agent)监控则将其扩展到多步推理、工具选择和任务完成情况。两者都超越了正常运行时间和错误率的范畴,旨在评估非确定性输出的质量,并检测行为偏离预期标准的情况。 生产链路追踪(Production tracing) 捕获了实现上述目标所需的执行数据。
与传统的 ML 监控(在结构化数据上跟踪特征分布和预测准确性)不同,AI 监控必须评估自由形式的语言输出、多步智能体推理、工具调用链、检索准确性和 Token 成本。传统的监控只能告诉你系统是否在运行;而 AI 监控能告诉你系统是否运行良好。
MLflow 提供了一套完整的 AI 监控堆栈:利用 LLM 评测器进行异步评分的自动在线评估、用于成本控制的可配置链路采样、用于调试的用户和会话上下文跟踪、人工反馈收集,以及用于幻觉检测、安全性评估等的内置评分器。 探索评估与监控文档.
生产环境中的智能体和 LLM 应用面临着开发过程中不存在的挑战
问题:由于模型更新、提示词(Prompt)变更或用户输入的变化,智能体的输出质量会无声无息地下降。
解决方案:持续的 LLM 评测器和人工反馈可以在用户失去信任之前检测出质量回归。
问题:如果没有针对每次请求的支出和响应时间的可见性,Token 成本和延迟可能会失控。
解决方案:带有各模型详细分类和异常检测的自动成本/Token 跟踪。
问题:生产环境中的智能体面临着开发阶段不存在的提示词注入、PII 泄露、越狱攻击和策略违规等问题。
解决方案:对每次请求进行基于确定性和 LLM 的实时安全评分。
问题:当质量下降或错误激增时,跨多步智能体工作流追踪根本原因非常复杂。
解决方案:带有评估分数的完整执行链路,能够实现快速的根本原因分析。
MLflow 提供了一套开源的 AI 监控堆栈,涵盖链路追踪、利用 LLM 评测器进行的自动质量评估、成本和 Token 跟踪、人工反馈收集以及实时安全护栏,且兼容任何 LLM 提供商和任何智能体框架。以下是设置方法。
通过上下文追踪生产请求
import mlflowimport osfrom fastapi import FastAPI, Requestfrom pydantic import BaseModelapp = FastAPI()class ChatRequest(BaseModel):message: str@app.post("/chat")@mlflow.tracedef handle_chat(request: Request, chat_request: ChatRequest):# Attach production context to every tracemlflow.update_current_trace(client_request_id=request.headers.get("X-Request-ID"),tags={"mlflow.trace.session": request.headers.get("X-Session-ID"),"mlflow.trace.user": request.headers.get("X-User-ID"),"environment": "production","app_version": os.getenv("APP_VERSION", "1.0.0"),"deployment_id": os.getenv("DEPLOYMENT_ID", "unknown"),},)response = generate_response(chat_request.message)return {"response": response}
注册评测器进行自动在线评估
收集关于链路的用户反馈
import mlflowfrom mlflow.entities import AssessmentSourcefrom fastapi import FastAPIapp = FastAPI()@app.post("/feedback")def submit_feedback(trace_id: str, is_correct: bool, user_id: str):mlflow.log_feedback(trace_id=trace_id,name="response_is_correct",value=is_correct,source=AssessmentSource(source_type="HUMAN",source_id=user_id,),)
MLflow 是最大的开源 面向智能体、LLM 和 ML 模型的 AI 工程平台,每月下载量超过 3000 万次。成千上万个组织使用 MLflow 来调试、评估、监控和优化生产级 AI 智能体和 LLM 应用,同时控制成本并管理模型和数据的访问。MLflow 由 Linux 基金会支持并以 Apache 2.0 许可证发布,提供了一套无厂商锁定的完整 AI 监控解决方案。 立即开始 →
在为智能体和 LLM 应用选择 AI 监控平台时,开源与专有 SaaS 工具之间的决策对您的团队、基础设施和数据所有权具有重大的长期影响。
开源 (MLflow) 使用 MLflow,您可以保持对生产链路和监控数据的完全控制。可以将其部署在自己的基础设施上,或使用 Databricks、AWS 或其他平台上的托管版本。没有按链路收费,没有使用限制,也没有厂商锁定。您的生产数据始终处于您的控制之下,并且 OpenTelemetry 的兼容性确保您可以将链路导出到任何后端。
专有 SaaS 工具:商业监控平台提供了便利,但牺牲了灵活性和控制权。它们通常按链路或按席位收费,这在大规模使用时会变得昂贵。您的生产数据会被发送到它们的服务器,这引起了敏感链路的隐私和合规性问题。您会被锁定在它们的生态系统中,导致难以更换供应商或自定义功能。
团队为何选择开源:运行生产级智能体的组织越来越多地选择 MLflow,因为它提供了企业级的监控,同时在数据主权、成本可预测性或灵活性方面毫不妥协。Apache 2.0 许可证和 Linux 基金会的支持确保 MLflow 保持真正的开放和社区驱动,而不受单一供应商控制。