AI 网关是一个中心化的代理层,通过单一的统一 API 将请求路由至 LLM 提供商。它负责管理凭据、跟踪使用情况、执行治理策略,并提供跨所有 LLM 调用的全面可观测性。随着智能体越来越多地通过以下方式连接到外部工具和数据源: MCP (模型上下文协议) 服务器,AI 网关还提供了一个中心化层,用于安全地管理对这些 MCP 服务器及相关工具的访问。
AI 网关为工程团队提供了对应用程序访问 LLM 方式的集中控制。它们负责路由请求、安全管理凭据、跟踪 Token 成本、执行治理策略并维护完整的审计追踪。随着 AI 系统从原型走向生产,网关对于安全性、合规性和成本控制变得至关重要。
与直接 LLM API 调用(会导致凭据散落在基础设施各处且无法洞察使用模式)不同,AI 网关将一切集中化。它提供单一身份验证点、自动使用情况跟踪、成本监控仪表板、用于 A/B 测试的流量分割、用于提高可靠性的自动回退链,以及完整的 追踪 集成,以便您在上下文中分析每一个请求。
诸如智能体、LLM 应用程序和 RAG 系统等 AI 系统,带来了直接 API 调用无法解决的独特运营挑战
问题: API 密钥散落在笔记本、CI 环境和开发人员机器中,造成了安全风险和合规性难题。
解决方案: 在网关中集中管理所有凭据。应用程序向网关进行身份验证,而非直接向 LLM 提供商验证。
问题: 当团队无法洞察谁在使用什么模型或花费了多少钱时,Token 成本会失控。
解决方案: 按端点、团队或项目跟踪使用情况和成本。识别昂贵的查询并优化支出。
问题: 切换 LLM 提供商需要在调用它们的每个应用程序中进行代码更改。
解决方案: 在网关中更改提供商配置,无需触动应用程序代码。可以进行模型 A/B 测试或设置自动回退。
问题: 若无集中控制或审计追踪,敏感数据和 PII(个人身份信息)可能会泄露给第三方 API。
解决方案: 在网关层强制执行 PII 脱敏、内容策略和访问控制。维护完整的审计日志。
LLM 网关通过单一的统一 API 将请求路由至 OpenAI、Anthropic 和 Bedrock 等大语言模型提供商。您的应用程序无需分别与每个提供商的 SDK 集成,只需指向网关的 OpenAI 兼容端点,并通过名称指定要使用的模型即可。
对于 LLM 应用程序(聊天机器人、内容生成器、摘要工具),LLM 网关可以集中管理凭据,使 API 密钥永远不会出现在应用程序代码中;它可以在一个仪表板中跟踪所有提供商的 Token 使用情况和成本;支持用于测试不同模型的流量分割;并在提供商宕机时提供自动回退链。
MLflow AI 网关 作为 MLflow 追踪服务器的一部分运行,并为任何 LLM 提供商暴露一个 OpenAI 兼容的端点。在 MLflow UI 中配置端点,切换提供商或模型时,您的应用程序代码无需更改。
随着 AI 智能体能力不断增强,它们越来越多地通过以下方式连接到外部工具和数据源: MCP (模型上下文协议) 服务器。AI 网关提供了一个中心化层,用于安全地管理这些访问——无需修改智能体代码,即可管控智能体可以访问哪些 MCP 服务器、跟踪跨会话的工具使用情况并执行策略。
MLflow AI 网关 与 MLflow Tracing 原生集成,因此通过网关发出的每一个请求(无论是发送给 LLM 提供商还是 MCP 服务器)都会自动成为一个 MLflow 追踪。这使您无需额外的插桩即可完全洞察智能体行为、Token 成本和工具使用情况。
AI 网关解决了生产级 AI 系统中面临的实际问题
全面的 AI 网关平台结合了七项能力
现代开源 AI 平台如 MLflow 可以轻松部署生产级的 AI 网关,且只需极少的设置。MLflow AI 网关作为 MLflow 追踪服务器的一部分运行,因此无需部署或维护单独的基础设施。
如需全面的设置指南,请访问 MLflow AI 网关快速入门文档。以下是开始使用的快速概述:
1. 安装支持 GenAI 的 MLflow
pip install 'mlflow[genai]'
2. 启动 MLflow 服务器
mlflow server
3. 在 MLflow UI 中配置您的第一个网关端点
导航至 MLflow UI 中的 AI 网关选项卡,创建新端点,选择您的 LLM 提供商(OpenAI、Anthropic、Bedrock 等),配置您的 API 凭据并保存。网关现在即可开始路由请求。
查看 MLflow AI 网关文档 以获取详细的配置选项以及流量分割和回退链等高级功能。
配置好网关后,使用 OpenAI SDK(或任何兼容 OpenAI 的客户端)将您的应用程序指向网关的基准 URL。网关会处理身份验证、将请求路由到正确的提供商,并自动为每个请求捕获 追踪信息。
示例:使用 OpenAI SDK 进行查询
from openai import OpenAIclient = OpenAI(base_url="https://your-mlflow-server/gateway/mlflow/v1",api_key="", # authentication handled by gateway)response = client.chat.completions.create(model="prod-gpt5", # name of your gateway endpointmessages=[{"role": "user", "content": "Summarize this support ticket..."}],)
示例:使用 Anthropic Claude SDK 进行查询
import anthropicclient = anthropic.Anthropic(base_url="https://your-mlflow-server/gateway/anthropic",api_key="dummy", # authentication handled by gateway)response = client.messages.create(model="my-claude-endpoint", # name of your gateway endpointmax_tokens=1024,messages=[{"role": "user", "content": "Summarize this support ticket..."}],)
MLflow 是最大的开源 用于智能体、LLM 和 ML 模型的 AI 工程平台,每月下载量超过 3000 万次。数以千计的组织使用 MLflow 来调试、评估、监控和优化生产质量的 AI 智能体和 LLM 应用程序,同时控制成本并管理对模型和数据的访问。MLflow 由 Linux 基金会支持,采用 Apache 2.0 许可,提供完整的 AI 网关解决方案,且不存在供应商锁定。 立即开始 →
在评估 AI 网关解决方案时,最重要的决定是使用独立网关还是集成在端到端 AI 平台中的网关。这一选择对团队的生产力、基础设施复杂性以及调试和改进 AI 应用程序的能力有着深远的影响。
独立网关(如 LiteLLM 等): 独立的 AI 网关解决了难题的一环:它代理您的 LLM 调用并集中管理凭据。但实际上,路由请求仅仅是开始。您仍然需要追踪 LLM 响应后在您的应用程序内部发生了什么,评估输出是否真的好,并将成本和延迟数据关联回特定的功能、提示词 (Prompts) 或模型版本。对于独立网关,这意味着需要集成单独的可观测性工具、单独的评估框架,并构建胶水代码将它们全部连接到相同的数据上。堆栈中的每一个新工具都意味着需要额外部署、监控和保持同步。
端到端平台 (MLflow) MLflow 消除了集成成本。因为 AI 网关、追踪和评估都存在于同一个平台中,您可以获得独立网关无法提供的自动收益:
另一种方案——将网关、可观测性平台和评估框架拼凑在一起——会产生数据孤岛、重复的配置和脆弱的集成面。MLflow 的方法是使网关成为团队已经在进行 GenAI 开发的平台的自然扩展,从而使治理和可观测性得以免费获得,而非作为事后补充。
在选择 AI 网关平台时,在开源与专有 SaaS 工具之间做出的决定会对您的基础设施、安全状况和成本产生长远的重大影响。
开源 (MLflow) 使用 MLflow AI 网关,您可以完全掌控网关基础设施和路由策略。在您自己的基础设施上部署,或在 Databricks 或 AWS 上使用托管版本。没有按请求收费,没有使用限制,也没有供应商锁定。您的 API 密钥和请求数据受您控制,并且您可以根据您的具体安全和合规性要求定制网关。MLflow 通过 OpenTelemetry 兼容的追踪集成任何 LLM 提供商。
专有 SaaS 网关: 商业 AI 网关平台提供了便利,但牺牲了灵活性和控制力。它们通常按请求或按席位收费,随着规模扩大,费用可能会变得昂贵。您的 API 密钥和请求数据会被发送到他们的服务器,引发隐私和合规性问题。您被锁定在他们的生态系统中,很难切换提供商或添加自定义功能。大多数专有网关仅支持一部分 LLM 提供商。
为什么团队选择开源: 构建生产 AI 应用程序的组织越来越多地选择 MLflow AI 网关,因为它在不牺牲数据主权、成本可预测性或灵活性的前提下,提供了企业级的路由和治理。Apache 2.0 许可和 Linux 基金会的支持确保 MLflow 保持真正的开放并由社区驱动,而不受单一供应商控制。