追踪 Groq

MLflow Tracing 在使用 Groq 时提供自动追踪功能。当通过调用 mlflow.groq.autolog() 函数启用 Groq 自动追踪后,使用 Groq SDK 进行交互式开发时将自动记录生成的追踪信息。
MLflow 会自动捕获有关 Groq 调用的以下信息
- 提示和完成响应
- 延迟
- 模型名称
- Token 用量(输入、输出和总 Token 数)
- 其他元数据,如
temperature(温度)、max_tokens(最大令牌数)(如果已指定) - 如果抛出任何异常
入门
1
安装依赖项
bash
pip install mlflow groq
2
启动 MLflow 服务器
- 本地 (pip)
- 本地 (docker)
如果您有本地 Python 环境 >= 3.10,您可以使用 mlflow CLI 命令在本地启动 MLflow 服务器。
bash
mlflow server
MLflow 还提供了一个 Docker Compose 文件,用于启动带有 postgres 数据库和 minio 服务器的本地 MLflow 服务器。
bash
git clone --depth 1 --filter=blob:none --sparse https://github.com/mlflow/mlflow.git
cd mlflow
git sparse-checkout set docker-compose
cd docker-compose
cp .env.dev.example .env
docker compose up -d
请参阅 说明文档 以获取更多详细信息,例如覆盖默认环境变量的方法。
3
启用跟踪并进行 API 调用
使用 mlflow.groq.autolog() 启用追踪,并像往常一样进行 API 调用。
python
import groq
import mlflow
import os
# Enable auto-tracing for Groq
mlflow.groq.autolog()
# Set a tracking URI and an experiment
mlflow.set_tracking_uri("https://:5000")
mlflow.set_experiment("Groq")
# Initialize Groq client
client = groq.Groq(api_key=os.getenv("GROQ_API_KEY"))
# Use the create method to create new message
message = client.chat.completions.create(
model="llama3-8b-8192",
messages=[
{
"role": "user",
"content": "Explain the importance of low latency LLMs.",
}
],
)
print(message.choices[0].message.content)
4
在 MLflow UI 中查看跟踪
访问 MLflow UI(地址为 https://:5000 或您的 MLflow 服务器 URL),您应该能看到 Groq API 调用的追踪记录。
支持的 API
请注意,仅支持同步调用,异步 API 和流式传输方法不会被追踪。
| 普通 | 流式传输 | 异步 |
|---|---|---|
| ✅ | - | - |
追踪 Token 使用量和成本
MLflow 会自动跟踪 Groq 的令牌使用情况和成本。每次 LLM 调用的令牌使用量都会记录在每个 Trace/Span 中,聚合的成本和时间趋势会显示在内置仪表板中。有关以编程方式访问此信息的详细信息,请参阅令牌使用和成本跟踪文档。
注意
目前,Groq 跟踪不支持音频转录和音频翻译。
禁用自动追踪
可以通过调用 mlflow.groq.autolog(disable=True) 或 mlflow.autolog(disable=True) 全局禁用 Groq 自动追踪。