
利用 LLM 裁判和人类反馈发现质量问题
预置 LLM 裁判
快速上手,使用内置的 LLM 裁判进行安全性、幻觉、检索质量和相关性检查。我们基于研究的裁判员提供与人类专家判断一致的准确、可靠的质量评估。

定制化 LLM 裁判
调整我们的基准模型,创建符合您业务需求和专家判断标准的自定义 LLM 裁判。

收集人类反馈
直接在您的应用程序中收集最终用户和领域专家的反馈。利用人工标注来验证 LLM 裁判的准确性、识别盲点并持续提升评估质量。

迭代提升质量
测试新的智能体版本
MLflow 的生成式 AI (GenAI) 评估 API 允许您使用评估和回归数据集测试新的智能体版本(提示词、模型、代码)。每个版本都链接到其评估结果,从而实现对改进过程的追踪。

利用代码驱动的指标进行自定义
使用我们的自定义指标 API,通过测量应用质量或性能的任何方面来定制评估。将任何 Python 函数(从正则表达式到自定义逻辑)转化为一个指标。
from mlflow.genai.scorers import scorer@scorerdef response_length(request, response):"""Check response is within length limits."""length = len(response.text.split())return length <= 500results = mlflow.genai.evaluate(data=eval_data,scorers=[response_length],)
通过评估审查界面识别根本原因
使用 MLflow 的评估 UI 可视化评估总结,并按记录查看结果,从而快速识别根本原因并寻找进一步的改进机会。

并排比较版本
跨智能体版本比较评估结果,以了解您的更改是提升了还是降低了质量。在链路比较 (Trace Comparison) UI 中并排查看具体问题,以查找差异、调试回归问题,并为下一个版本提供指导。

4 个简单步骤即可开始
从零开始,几分钟内即可评估您的智能体。无需复杂的配置。开始使用 →
1
启动 MLflow 服务器
一条命令即可开始。同时也提供 Docker 设置方案。
bash
~30 秒
2
启用链路追踪 (Tracing)
添加极少量代码,即可开始从您的智能体或大模型应用中捕获链路。
python
~30 秒
3
运行您的代码
像往常一样运行您的代码。在 MLflow UI 中探索链路和指标。
python
~1 分钟
4
使用 LLM 裁判进行评估
运行内置的 LLM 裁判,自动为您应用的质量打分。
python
~1 分钟
参与其中
与开源社区建立联系
加入数百万 MLflow 用户