Skip to main content
MiniMax Music 3 根据歌词和音乐描述生成包含人声与伴奏的完整歌曲。本页介绍如何使用 SGLang-Omni 在 NVIDIA CUDA GPU 上部署 HTTP 服务;这是面向服务器的自托管部署,不是消费级设备本地运行指南。
模型卡声明模型原生支持最长约 5 分钟的歌曲。SGLang-Omni 最多接受 9,000 个声学帧,按每秒 25 帧换算为 6 分钟请求上限。框架上限不代表模型额外验证了 1 分钟能力。需要保持在模型已公开的 5 分钟范围内时,请将 max_new_tokens 设为不超过 7,500

部署状态

固定模型 revision 和推理框架版本可以避免命令随 main 分支变化,但不代表 MiniMax 已验证所有兼容的 GPU、驱动和操作系统组合。

硬件基线

SGLang-Omni 只公开了一套参考音频配置和两种阶段放置方式,尚未公开 Music 3 的峰值显存、最低 GPU 显存、主机内存、最低驱动版本、生成耗时或实时系数。 单 GPU 命令不代表任意 CUDA GPU 都具备足够显存。接收生产流量前,请先在实际硬件上验证短音频请求。模型仓库当前显示文件总量约 57.4 GB;还需为 Python 环境、下载元数据和临时文件预留额外磁盘空间。

快速开始

安装固定版本的运行环境

请使用配有 NVIDIA CUDA GPU 的干净 Linux 环境。SGLang-Omni 0.1.3 固定使用 CUDA 13 运行时组件、PyTorch 2.11.0 和 SGLang 0.5.16。上游尚未为 Music 3 配置公开准确的 NVIDIA 最低驱动版本;安装前请确认主机驱动支持所安装的 CUDA 运行时。
继续操作前,最后一个值必须为 True。UCX 与 CUDA 编译依赖请参阅 SGLang-Omni 安装指南

下载固定版本的权重

启动服务

快速开始默认只监听本机回环地址。保持当前终端运行:

检查服务健康状态

在另一个终端执行:
/health 应返回 HTTP 200,状态为 healthy 且 running。/v1/models 应包含 MiniMaxAI/MiniMax-Music3

生成并验证歌曲

文件必须是非空 WAV,并显示 channels=2sample_rate=32000sample_width_bytes=2750 帧最多允许 30 秒音频;模型输出音频结束标记时,实际时长可以更短。

能力边界

SGLang-Omni 声明,在相同环境中保持歌词、instructions、seed 和长度完全一致,可以得到字节级一致的音频。不要假设不同模型 revision、推理框架版本或硬件栈之间仍可保持字节级一致。

请求协议

文本提示分词后最多为 5,000 token。如果其他字段均有效但请求因这一限制被拒绝,请缩短歌词或 instructions。
结构标签必须单独占一行。例如,应写成 [Verse]\nWalking down the street。如果把歌词写在标签同一行,规范化阶段可能在不报错的情况下删除该行歌词。
不要传入 temperaturetop_ptop_krepetition_penaltyvoice、参考音频字段、languagetask_type。速度和人声特征应写入 instructions HTTP 客户端还有一种名为 streaming response 的机制,表示客户端把已经产生的 HTTP 响应体分块写入磁盘。它不会让 Music 3 的模型生成变成流式。本指南统一使用普通的 curl --output,避免混淆这两个概念。

权重、缓存与离线部署

  • 官方权重:MiniMaxAI/MiniMax-Music3
  • 本文固定的权重:revision fbdf52f
  • Hugging Face 默认缓存目录为 ~/.cache/huggingface/hub;可通过 HF_HOMEHF_HUB_CACHE 调整。
  • 本文使用 --local-dir,服务启动时直接加载固定本地路径,不解析远程 main
  • 截至文档核验日期,Music 3 模型卡没有链接 MiniMax 官方 ModelScope 镜像。
离线部署时,先在联网机器下载固定 revision,再把完整目录复制到目标主机,并使用本地路径启动。可通过以下环境变量阻止意外访问网络:
下载中断或文件损坏时,请使用相同 revision 重新执行 hf download。只有需要替换本地文件,而不是续传或复用已有文件时,才添加 --force-download

生产部署与安全

使用两张 GPU

SGLang-Omni 会把自回归阶段放在第一张可见 GPU,把 DiT 和音频解码阶段放在第二张:
这只是阶段放置选项,不代表任何特定双 GPU 组合具备最低显存或性能保证。

规划并发

Music 3 在两个生成阶段都使用 classifier-free guidance。每个请求会在自回归引擎中占用两行 KV Cache。提高请求上限时,需要按准入请求数的两倍规划容量:
在实际硬件上测量峰值显存和延迟之前,不要提高此值。先用 10 秒、250 帧的片段验证歌词和音乐描述,再生成完整歌曲,可以降低迭代成本。

安全地开放服务

尽可能让模型服务监听 127.0.0.1。需要远程访问时,应在前面部署带身份验证的 API 网关或反向代理,并配置 TLS、请求大小限制、速率限制、超时和网络白名单。不要把未经鉴权的 0.0.0.0:8000 直接暴露到互联网。配置访问日志和可观测性时,应将歌词和音乐描述视为潜在敏感数据。

故障排查

遇到多 GPU NCCL 或 UCX 错误时,先确认单 GPU 命令可以启动,再检查 GPU 可见性、GPU 间连接,以及 SGLang-Omni 文档中的 UCX 前置依赖。

License 与相关资源

模型 License 包含产品署名、商业收入门槛、安全措施、知识产权和 Acceptable Use Policy 等要求。向第三方提供 Music 3 服务前,请阅读权威 License 原文并落实全部适用条款。SGLang-Omni 另行采用 Apache-2.0 License。