跳到主要内容
实战指南
使用 MLflow 构建、评估和观察智能体(Agent)及 LLM 应用的实践指南——涵盖从追踪(Tracing)和提示词管理到 LLM-as-a-judge 评估及生产部署的全流程。
智能体优化流水线
构建一个具备工具调用能力的智能体,使用领域特定的评估器进行评估,根据专家反馈对齐评估器,并利用 GEPA 优化系统提示词。
evaluation (评估)optimization (优化)agents (智能体)prompts (提示词)
不同 LLM 提供商的成本与质量权衡分析
利用 MLflow 的评估和追踪功能,对比不同 LLM 提供商的质量与成本。
evaluation (评估)cost (成本)tracing (追踪)
构建自定义 LLM 评估器
使用内置指南评分器、自定义编程评分器和自定义基于 LLM 的评估器来评估生成式 AI 的输出。
evaluation (评估)scorers (评分器)judges (评估器)
评估驱动开发
使用 MLflow 评估来发现生成式 AI 应用的弱点,进行修复,并在可重复的循环中衡量改进效果。
evaluation (评估)development (开发)prompts (提示词)
追踪与评估 LangGraph 智能体
使用 LangGraph 构建旅行规划智能体,通过 MLflow 追踪每一步流程,并评估工具选择的准确性。
agents (智能体)tracing (追踪)evaluation (评估)langgraph
评估多轮对话智能体
使用 MLflow 的对话评分器评估多轮客户支持聊天的质量。
agents (智能体)evaluation (评估)multi-turn (多轮)
追踪与评估 OpenAI 智能体
使用 OpenAI 函数调用构建电子商务智能体,通过 MLflow 进行追踪,并评估工具选择的准确性。
agents (智能体)tracing (追踪)evaluation (评估)openai
使用 MLflow Tracing 进行生产环境可观测性
为生产环境的聊天机器人添加 MLflow Tracing 插桩,并构建延迟仪表板、错误监控器和令牌使用报告。
tracing (追踪)observability (可观测性)production (生产)
提示词工程生命周期
利用 MLflow 的提示词注册表(Prompt Registry)和评估框架,对提示词模板进行版本控制、评估和推广。
prompts (提示词)evaluation (评估)registry (注册表)
端到端 RAG 评估
构建一个 RAG 流水线,使用 MLflow 追踪,并通过内置评估器评估检索和生成的质量。
evaluation (评估)ragretrieval (检索)
LLM 应用的红队测试
使用 MLflow 的安全评分器和自定义指南,通过对抗性输入测试您的 LLM 应用。
evaluation (评估)safety (安全)red-teaming (红队测试)
评估 Databricks Genie Spaces
一套完整的流水线,用于利用 MLflow 追踪、评估和改进 Databricks Genie 空间。
databricksgenieevaluation (评估)tracing (追踪)agents (智能体)
使用 LLM 评估器进行 Genie 评估
使用内置和自定义评估器对 Genie 追踪结果进行评分,以发现回答和 SQL 生成中的质量问题。
databricksgenieevaluation (评估)agents (智能体)
Genie 空间改进生成器
提取未通过评估的追踪记录,结合您的 Genie 空间配置,利用 LLM 生成可直接复制粘贴的修复方案。
databricksgenieevaluation (评估)agents (智能体)
Genie 对话追踪流水线
从 Genie 空间提取对话,并将每一条对话记录为 MLflow 追踪,以便进行检查和评估。
databricksgenietracing (追踪)agents (智能体)