MLflow:用于 LLM 和 Agent 的 AI 工程平台
MLflow 是目前最大的开源 面向 Agent 和 LLM 的 AI 工程平台。MLflow 使各种规模的团队能够调试、评估、监控并优化生产级的 AI 应用,同时控制成本并管理对模型和数据的访问。凭借每月超过 3000 万次的下载量,全球数以千计的组织每天都依赖 MLflow 自信地将 AI 推向生产环境。
MLflow 为 Agent 和 LLM 应用提供了一套全面的功能,包括生产级的可观测性、评估、提示词管理,以及用于管理成本和模型访问的 AI 网关等等。
开源
加入成千上万个使用 MLflow 构建 Agent 和 LLM 应用的团队 —— 我们拥有超过 2 万个 GitHub Star 和每月超过 5000 万次的下载量。作为 Linux 基金会的一部分,MLflow 确保您的 AI 基础设施保持开放且供应商中立。
OpenTelemetry
MLflow Tracing 完全兼容 OpenTelemetry,并原生支持 GenAI 语义约定(Semantic Conventions),使其摆脱了供应商锁定,并能轻松集成到您现有的可观测性技术栈中。
一体化平台
管理从原型到生产的整个 AI 开发旅程。在一个平台内跟踪提示词、评估质量、部署 AI Agent 并监控性能。
完全可观测性
通过全面的追踪功能洞察每一次 AI 决策,捕捉提示词、检索、工具调用和 LLM 响应。自信地调试复杂的业务流程。
评估与监控
利用 LLM 评估器(LLM judges)和自定义指标告别手动测试。系统地评估每一次更改,以确保 AI 应用持续改进。
框架集成
使用任何 Agent 框架或 LLM 提供商。通过 100 多种集成和可扩展的 API,MLflow 可适配您的技术栈,而非让您去适配平台。
试用 MLflow LLM 和智能体 Demo
了解面向 LLM 和 AI 智能体的 MLflow 的最快方法是试用 Demo。点击启动 Demo ↓
公开 Demo
访问 demo.mlflow.org,探索预装了样本数据的公开托管 MLflow 实例。
从 UI 启动
要启动 Demo,请点击 MLflow UI 顶部页面上的“Start Demo”按钮。

从 CLI 启动
或者,您可以使用 mlflow demo 命令从命令行启动 Demo。此选项不需要您运行 MLflow 服务器。
uvx mlflow demo
可观测性
使用 MLflow 的追踪 (tracing) 功能调试和迭代 Agent 及 LLM 应用,该功能可捕获应用程序的完整执行过程,包括提示词、检索和工具调用。MLflow 开源且兼容 OpenTelemetry 的追踪 SDK 有助于避免供应商锁定。
评估
通过利用 LLM-as-a-judge(以 LLM 作为评估者)指标来模拟人类专家,准确衡量自由形式的语言输出,从而评估并提升 Agent 的质量。您可以访问针对幻觉或相关性等常见指标的预构建评估器,也可以根据您的业务需求和专家见解开发自定义评估器。
提示词管理与优化
直接通过 MLflow UI 对提示词模板进行版本控制、比较、迭代和发现。在 Agent 或应用程序代码的多个版本中重复使用提示词,并查看丰富的血缘关系,识别哪些版本正在使用哪些提示词。通过自动化提示词优化加速开发,利用数据驱动的算法改进提示词,无需手动试错。
随处运行
MLflow 可用于多种环境,包括本地环境、本地集群、云平台和托管服务。作为一个开源平台,MLflow 是供应商中立的;无论您是在构建 AI Agent、LLM 应用还是机器学习模型,您都可以使用 MLflow 的核心功能——追踪、评估、实验跟踪、部署等。
向 AI 询问有关 MLflow 的信息
社区
与志同道合的开发者建立联系、提问并获取最新动态——加入我们在 Slack、GitHub、LinkedIn 等平台上的活跃 MLflow 社区!
在社区页面了解如何参与并发现我们所有的交流渠道。

