评估
智能体评估
充满信心地 进行评估 在开发和生产环境中评估质量,以发现问题并进行迭代测试以优化改进。
MLflow evaluations screenshot
利用 LLM 裁判和人类反馈发现质量问题

预置 LLM 裁判

快速上手,使用内置的 LLM 裁判进行安全性、幻觉、检索质量和相关性检查。我们基于研究的裁判员提供与人类专家判断一致的准确、可靠的质量评估。

Pre-built LLM judges screenshot

定制化 LLM 裁判

调整我们的基准模型,创建符合您业务需求和专家判断标准的自定义 LLM 裁判。

Customized LLM judges screenshot

收集人类反馈

直接在您的应用程序中收集最终用户和领域专家的反馈。利用人工标注来验证 LLM 裁判的准确性、识别盲点并持续提升评估质量。

Collect human feedback screenshot
迭代提升质量

测试新的智能体版本

MLflow 的生成式 AI (GenAI) 评估 API 允许您使用评估和回归数据集测试新的智能体版本(提示词、模型、代码)。每个版本都链接到其评估结果,从而实现对改进过程的追踪。

Test new agent versions screenshot

利用代码驱动的指标进行自定义

使用我们的自定义指标 API,通过测量应用质量或性能的任何方面来定制评估。将任何 Python 函数(从正则表达式到自定义逻辑)转化为一个指标。

from mlflow.genai.scorers import scorer
@scorer
def response_length(request, response):
"""Check response is within length limits."""
length = len(response.text.split())
return length <= 500
results = mlflow.genai.evaluate(
data=eval_data,
scorers=[response_length],
)

通过评估审查界面识别根本原因

使用 MLflow 的评估 UI 可视化评估总结,并按记录查看结果,从而快速识别根本原因并寻找进一步的改进机会。

Identify root causes with evaluation review UIs screenshot

并排比较版本

跨智能体版本比较评估结果,以了解您的更改是提升了还是降低了质量。在链路比较 (Trace Comparison) UI 中并排查看具体问题,以查找差异、调试回归问题,并为下一个版本提供指导。

Compare versions side-by-side screenshot
4 个简单步骤即可开始
从零开始,几分钟内即可评估您的智能体。无需复杂的配置。开始使用 →
1

启动 MLflow 服务器

一条命令即可开始。同时也提供 Docker 设置方案。

bash
uvx mlflow server
~30 秒
2

启用链路追踪 (Tracing)

添加极少量代码,即可开始从您的智能体或大模型应用中捕获链路。

python
import mlflow
mlflow.set_tracking_uri(
"https://:5000"
)
mlflow.openai.autolog()
~30 秒
3

运行您的代码

像往常一样运行您的代码。在 MLflow UI 中探索链路和指标。

python
from openai import OpenAI
client = OpenAI()
client.responses.create(
model="gpt-5-mini",
input="Hello!",
)
~1 分钟
4

使用 LLM 裁判进行评估

运行内置的 LLM 裁判,自动为您应用的质量打分。

python
from mlflow.genai.scorers import (
Safety,
Correctness,
)
traces = mlflow.search_traces()
mlflow.genai.evaluate(
data=traces,
scorers=[
Safety(),
Correctness(),
],
)
~1 分钟