面向 LLM 和智能体的 AI 网关

AI 网关是一个中心化的代理层,通过单一的统一 API 将请求路由至 LLM 提供商。它负责管理凭据、跟踪使用情况、执行治理策略,并提供跨所有 LLM 调用的全面可观测性。随着智能体越来越多地通过以下方式连接到外部工具和数据源: MCP (模型上下文协议) 服务器,AI 网关还提供了一个中心化层,用于安全地管理对这些 MCP 服务器及相关工具的访问。

AI 网关为工程团队提供了对应用程序访问 LLM 方式的集中控制。它们负责路由请求、安全管理凭据、跟踪 Token 成本、执行治理策略并维护完整的审计追踪。随着 AI 系统从原型走向生产,网关对于安全性、合规性和成本控制变得至关重要。

与直接 LLM API 调用(会导致凭据散落在基础设施各处且无法洞察使用模式)不同,AI 网关将一切集中化。它提供单一身份验证点、自动使用情况跟踪、成本监控仪表板、用于 A/B 测试的流量分割、用于提高可靠性的自动回退链,以及完整的 追踪 集成,以便您在上下文中分析每一个请求。

快速导航

为什么 AI 网关很重要

诸如智能体、LLM 应用程序和 RAG 系统等 AI 系统,带来了直接 API 调用无法解决的独特运营挑战

安全性与凭据管理

问题: API 密钥散落在笔记本、CI 环境和开发人员机器中,造成了安全风险和合规性难题。

解决方案: 在网关中集中管理所有凭据。应用程序向网关进行身份验证,而非直接向 LLM 提供商验证。

成本可见性与控制

问题: 当团队无法洞察谁在使用什么模型或花费了多少钱时,Token 成本会失控。

解决方案: 按端点、团队或项目跟踪使用情况和成本。识别昂贵的查询并优化支出。

供应商灵活性

问题: 切换 LLM 提供商需要在调用它们的每个应用程序中进行代码更改。

解决方案: 在网关中更改提供商配置,无需触动应用程序代码。可以进行模型 A/B 测试或设置自动回退。

治理与合规性

问题: 若无集中控制或审计追踪,敏感数据和 PII(个人身份信息)可能会泄露给第三方 API。

解决方案: 在网关层强制执行 PII 脱敏、内容策略和访问控制。维护完整的审计日志。

LLM 网关

LLM 网关通过单一的统一 API 将请求路由至 OpenAI、Anthropic 和 Bedrock 等大语言模型提供商。您的应用程序无需分别与每个提供商的 SDK 集成,只需指向网关的 OpenAI 兼容端点,并通过名称指定要使用的模型即可。

对于 LLM 应用程序(聊天机器人、内容生成器、摘要工具),LLM 网关可以集中管理凭据,使 API 密钥永远不会出现在应用程序代码中;它可以在一个仪表板中跟踪所有提供商的 Token 使用情况和成本;支持用于测试不同模型的流量分割;并在提供商宕机时提供自动回退链。

MLflow AI 网关 作为 MLflow 追踪服务器的一部分运行,并为任何 LLM 提供商暴露一个 OpenAI 兼容的端点。在 MLflow UI 中配置端点,切换提供商或模型时,您的应用程序代码无需更改。

MCP 服务器访问管理

随着 AI 智能体能力不断增强,它们越来越多地通过以下方式连接到外部工具和数据源: MCP (模型上下文协议) 服务器。AI 网关提供了一个中心化层,用于安全地管理这些访问——无需修改智能体代码,即可管控智能体可以访问哪些 MCP 服务器、跟踪跨会话的工具使用情况并执行策略。

MLflow AI 网关 与 MLflow Tracing 原生集成,因此通过网关发出的每一个请求(无论是发送给 LLM 提供商还是 MCP 服务器)都会自动成为一个 MLflow 追踪。这使您无需额外的插桩即可完全洞察智能体行为、Token 成本和工具使用情况。

AI 网关的常见用例

AI 网关解决了生产级 AI 系统中面临的实际问题

  • 保护 API 密钥: 无需将 OpenAI 或 Anthropic API 密钥分发给每位开发人员和服务,将其加密存储在网关中即可。应用程序使用您现有的身份验证系统向网关进行身份验证,凭据永远不会离开服务器。
  • 按团队跟踪 Token 成本: 当多个团队共享同一个 LLM 提供商账户时,网关会按端点或团队跟踪使用情况,从而轻松分配成本并识别优化机会。
  • 模型变更的 A/B 测试: 在从 GPT 切换到 Claude(或从一个模型版本切换到另一个)之前,使用 流量分割 将 10% 的请求路由到新模型。在全面迁移之前,对比质量指标和成本。
  • 自动故障转移: 为网关配置回退链:如果 OpenAI 不可用,自动将请求路由到 Anthropic。这可以在不更改应用程序代码的情况下提高可靠性。
  • 执行内容护栏: 在网关层应用内容安全过滤器、PII 脱敏和毒性检测,确保所有 LLM 请求和响应在到达用户之前均符合合规性和安全要求。
  • 合规性审计追踪: 捕获流经网关的每个请求和响应的完整日志。证明符合数据策略和监管要求。
  • 管控 MCP 服务器访问: 随着智能体通过 MCP 服务器连接到外部工具和数据源,网关提供了对智能体可访问哪些服务器的集中控制,跟踪跨会话的工具使用情况并执行访问策略——所有这些都无需修改您的智能体代码。

AI 网关的关键组件

全面的 AI 网关平台结合了七项能力

  • 统一 API:适用于所有 LLM 提供商的单一 OpenAI 兼容 API。通过更改配置而非代码来切换模型。
  • 凭据管理:集中式加密存储 API 密钥。应用程序向网关进行身份验证,而非直接向 LLM 提供商验证。
  • 使用情况跟踪:按端点、模型或团队自动跟踪 Token 使用情况、成本、延迟和错误率。
  • 流量分割:通过将一定比例的请求路由至每个模型或提供商,对不同模型进行 A/B 测试。无需更改代码即可进行渐进式发布。
  • 回退与重试逻辑:主服务不可用时自动故障转移至备份提供商。针对瞬态错误配置重试策略。
  • 可观测性集成:与追踪平台原生集成,捕获请求上下文、评估响应并监控生产指标。
  • 护栏与策略执行:在网关层应用内容过滤器、PII 脱敏和安全策略,确保所有 LLM 请求符合合规性和安全要求。

开始使用 AI 网关

现代开源 AI 平台如 MLflow 可以轻松部署生产级的 AI 网关,且只需极少的设置。MLflow AI 网关作为 MLflow 追踪服务器的一部分运行,因此无需部署或维护单独的基础设施。

设置 MLflow AI 网关

如需全面的设置指南,请访问 MLflow AI 网关快速入门文档。以下是开始使用的快速概述:

1. 安装支持 GenAI 的 MLflow

bash
pip install 'mlflow[genai]'

2. 启动 MLflow 服务器

bash
mlflow server

3. 在 MLflow UI 中配置您的第一个网关端点

导航至 MLflow UI 中的 AI 网关选项卡,创建新端点,选择您的 LLM 提供商(OpenAI、Anthropic、Bedrock 等),配置您的 API 凭据并保存。网关现在即可开始路由请求。

查看 MLflow AI 网关文档 以获取详细的配置选项以及流量分割和回退链等高级功能。

查询网关

配置好网关后,使用 OpenAI SDK(或任何兼容 OpenAI 的客户端)将您的应用程序指向网关的基准 URL。网关会处理身份验证、将请求路由到正确的提供商,并自动为每个请求捕获 追踪信息。

示例:使用 OpenAI SDK 进行查询

python
from openai import OpenAI
client = OpenAI(
base_url="https://your-mlflow-server/gateway/mlflow/v1",
api_key="", # authentication handled by gateway
)
response = client.chat.completions.create(
model="prod-gpt5", # name of your gateway endpoint
messages=[{"role": "user", "content": "Summarize this support ticket..."}],
)

示例:使用 Anthropic Claude SDK 进行查询

python
import anthropic
client = anthropic.Anthropic(
base_url="https://your-mlflow-server/gateway/anthropic",
api_key="dummy", # authentication handled by gateway
)
response = client.messages.create(
model="my-claude-endpoint", # name of your gateway endpoint
max_tokens=1024,
messages=[{"role": "user", "content": "Summarize this support ticket..."}],
)

MLflow 是最大的开源 用于智能体、LLM 和 ML 模型的 AI 工程平台,每月下载量超过 3000 万次。数以千计的组织使用 MLflow 来调试、评估、监控和优化生产质量的 AI 智能体和 LLM 应用程序,同时控制成本并管理对模型和数据的访问。MLflow 由 Linux 基金会支持,采用 Apache 2.0 许可,提供完整的 AI 网关解决方案,且不存在供应商锁定。 立即开始 →

端到端平台 vs. 独立网关

在评估 AI 网关解决方案时,最重要的决定是使用独立网关还是集成在端到端 AI 平台中的网关。这一选择对团队的生产力、基础设施复杂性以及调试和改进 AI 应用程序的能力有着深远的影响。

独立网关(如 LiteLLM 等): 独立的 AI 网关解决了难题的一环:它代理您的 LLM 调用并集中管理凭据。但实际上,路由请求仅仅是开始。您仍然需要追踪 LLM 响应后在您的应用程序内部发生了什么,评估输出是否真的好,并将成本和延迟数据关联回特定的功能、提示词 (Prompts) 或模型版本。对于独立网关,这意味着需要集成单独的可观测性工具、单独的评估框架,并构建胶水代码将它们全部连接到相同的数据上。堆栈中的每一个新工具都意味着需要额外部署、监控和保持同步。

端到端平台 (MLflow) MLflow 消除了集成成本。因为 AI 网关、追踪和评估都存在于同一个平台中,您可以获得独立网关无法提供的自动收益:

  • 追踪是自动的: 每个网关请求都会成为一个 MLflow 追踪,无需额外的 SDK 或插桩。这些追踪包括完整的请求/响应载荷以及延迟和 Token 计数。
  • 评估基于真实流量运行: 通过网关捕获的追踪直接馈送到 MLflow 的评估 API,因此您可以对生产数据运行 LLM 裁判,而无需导出任何内容或连接管道。
  • 调试只需一键: 当使用仪表板显示延迟激增或错误率上升时,您可以直接深入到导致问题的单个追踪中——无需在工具之间切换上下文。
  • 成本数据具有上下文: Token 成本与应用程序追踪相关联,向您展示支出增加或减少的具体原因。

另一种方案——将网关、可观测性平台和评估框架拼凑在一起——会产生数据孤岛、重复的配置和脆弱的集成面。MLflow 的方法是使网关成为团队已经在进行 GenAI 开发的平台的自然扩展,从而使治理和可观测性得以免费获得,而非作为事后补充。

开源 vs. 专有 AI 网关

在选择 AI 网关平台时,在开源与专有 SaaS 工具之间做出的决定会对您的基础设施、安全状况和成本产生长远的重大影响。

开源 (MLflow) 使用 MLflow AI 网关,您可以完全掌控网关基础设施和路由策略。在您自己的基础设施上部署,或在 Databricks 或 AWS 上使用托管版本。没有按请求收费,没有使用限制,也没有供应商锁定。您的 API 密钥和请求数据受您控制,并且您可以根据您的具体安全和合规性要求定制网关。MLflow 通过 OpenTelemetry 兼容的追踪集成任何 LLM 提供商。

专有 SaaS 网关: 商业 AI 网关平台提供了便利,但牺牲了灵活性和控制力。它们通常按请求或按席位收费,随着规模扩大,费用可能会变得昂贵。您的 API 密钥和请求数据会被发送到他们的服务器,引发隐私和合规性问题。您被锁定在他们的生态系统中,很难切换提供商或添加自定义功能。大多数专有网关仅支持一部分 LLM 提供商。

为什么团队选择开源: 构建生产 AI 应用程序的组织越来越多地选择 MLflow AI 网关,因为它在不牺牲数据主权、成本可预测性或灵活性的前提下,提供了企业级的路由和治理。Apache 2.0 许可和 Linux 基金会的支持确保 MLflow 保持真正的开放并由社区驱动,而不受单一供应商控制。

常见问题 (FAQ)

AI 网关是一个中心化的代理层,位于您的应用程序和 LLM 提供商(OpenAI、Anthropic、Bedrock 等)之间。它为您的所有 LLM 调用提供单一的统一 API 端点,集中化 API 密钥管理,跟踪使用情况和成本,并执行治理策略。AI 网关消除了在整个基础设施中散布 API 密钥的需要,并让您完全了解您的组织如何使用 LLM。

相关资源