> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-comfy-docs-comfyapi-search.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# ByteDanceSeedAudio - ComfyUI Built-in Node Documentation

> 使用 ByteDance Seed Audio 1.0，通过单个提示词生成语音、音乐、音效和多说话人对话。

使用 ByteDance Seed Audio 1.0，通过单个提示词生成语音、音乐、音效和多说话人对话。在提示词中描述声音、情感、氛围、背景音乐和音效，并包含要朗读的台词。可选择内置预设音色，从最多 3 个参考音频片段克隆音色（在提示词中标记为 @Audio1-3），或从角色图像派生音色。每次运行最多生成 2 分钟音频。多语言模型支持 20 种语言以及基于时间戳的时序控制。

## 输入

| 参数                  | 描述                                                                                                                                                                                                                       | 数据类型   | 必填 | 范围                                                                                    |
| ------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------ | ------ | -- | ------------------------------------------------------------------------------------- |
| `text_prompt`       | 描述声音、情感、节奏、氛围、背景音乐和音效，并包含要朗读的台词（对话中可内联命名角色）。在 "audio reference" 模式下，按顺序将连接的片段称为 @Audio1、@Audio2、@Audio3。使用多语言模型时，引号中的台词可以以时间戳范围开头，用于控制其开始时间和持续时间，例如 `[5.5s:8.0s] Wait for me!`。提示词应使用与要朗读台词相同的语言书写。最少 1 个字符，最多 3000 个字符。 | STRING | 是  | 1 到 3000 个字符                                                                          |
| `reference_mode`    | 如何为音色设置条件："text only"（在提示词中描述所有内容）、"audio reference"（克隆最多 3 个音色，标记为 @Audio1-3）、"image reference"（从一张角色图像派生音色）或 "preset voice"（选择一个内置命名音色来朗读提示词）。                                                                         | COMBO  | 是  | `"text only"`<br />`"audio reference"`<br />`"image reference"`<br />`"preset voice"` |
| `reference_audio_1` | 用于音色克隆的参考片段，在提示词中标记为 @Audio1。最长 30 秒。仅当 `reference_mode` 为 "audio reference" 时可用。                                                                                                                                        | AUDIO  | 否  | 最多 30 秒                                                                               |
| `reference_audio_2` | 在提示词中标记为 @Audio2 的参考片段。最长 30 秒。仅当 `reference_mode` 为 "audio reference" 时可用。                                                                                                                                              | AUDIO  | 否  | 最多 30 秒                                                                               |
| `reference_audio_3` | 在提示词中标记为 @Audio3 的参考片段。最长 30 秒。仅当 `reference_mode` 为 "audio reference" 时可用。                                                                                                                                              | AUDIO  | 否  | 最多 30 秒                                                                               |
| `reference_image`   | 单张角色图像；模型会从中派生音色。不能与参考音频组合使用。仅当 `reference_mode` 为 "image reference" 时可用。                                                                                                                                                | IMAGE  | 否  | -                                                                                     |
| `preset_voice`      | 一个内置 TTS 2.0 音色，用于朗读提示词。无需参考片段，且此模式下不使用 @AudioN 标签。当 `reference_mode` 为 "preset voice" 时必填。                                                                                                                              | COMBO  | 否  | 多个内置预设音色选项（默认选择第一个选项）                                                                 |
| `sample_rate`       | 输出采样率，单位为 Hz。（默认值："24000"）                                                                                                                                                                                               | COMBO  | 是  | `"8000"`<br />`"16000"`<br />`"24000"`<br />`"32000"`<br />`"44100"`<br />`"48000"`   |
| `speech_rate`       | 语速。0 = 正常，100 = 2.0 倍，-50 = 0.5 倍。（默认值：0）                                                                                                                                                                                | INT    | 是  | -50 到 100                                                                             |
| `loudness_rate`     | 响度。0 = 正常，100 = 2.0 倍，-50 = 0.5 倍。（默认值：0）                                                                                                                                                                                | INT    | 是  | -50 到 100                                                                             |
| `pitch_rate`        | 音高偏移，单位为半音（-12 到 12）。（默认值：0）                                                                                                                                                                                             | INT    | 是  | -12 到 12                                                                              |
| `seed`              | 种子控制节点是否应重新运行；无论种子如何，结果都是非确定性的。（默认值：42）                                                                                                                                                                                  | INT    | 是  | 0 到 2147483647                                                                        |
| `model`             | 模型版本。`seed-audio-1.0-multilingual` 支持 20 种语言，并可通过 `[5.5s:8.0s]` 时间戳进行逐句时序控制。`seed-audio-1.0` 仅支持英语和中文，不支持时序控制。（默认值："seed-audio-1.0-multilingual"）                                                                        | COMBO  | 否  | `"seed-audio-1.0-multilingual"`<br />`"seed-audio-1.0"`                               |

### 参数约束

* **参考模式依赖关系**：`reference_mode` 参数决定需要哪些其他输入：
  * **"text only"**：不需要其他输入。提示词中不得包含 @AudioN 标签。
  * **"audio reference"**：要求至少连接 `reference_audio_1`、`reference_audio_2` 或 `reference_audio_3` 中的一个。参考片段必须按顺序连接且不能有间隔。每个片段最长 30 秒。如果提示词中使用了 @AudioN 标签，则最高标签编号不得超过已连接参考片段的数量。
  * **"image reference"**：要求连接 `reference_image`。不使用 @AudioN 标签；提示词应仅包含要合成的文本。
  * **"preset voice"**：要求选择预设音色。整个提示词将使用所选音色朗读；@AudioN 标签不会用作参考，@Audio2 或更高标签会被拒绝。

* **音频参考顺序**：在 "audio reference" 模式下，参考音频输入必须从 `reference_audio_1` 开始按顺序连接，不能有间隔。例如，可以连接 `reference_audio_1` 和 `reference_audio_2`，但不能在没有 `reference_audio_2` 的情况下连接 `reference_audio_1` 和 `reference_audio_3`。

* **最大音频标签数**：在 "audio reference" 模式下，最多可连接 3 个参考片段（@Audio1、@Audio2、@Audio3），提示词中最高的 @AudioN 标签不能超过已连接参考音频输入的数量。

* **模型差异**：`seed-audio-1.0-multilingual` 模型支持 20 种语言（英语、中文、日语、韩语、墨西哥西班牙语和卡斯蒂利亚西班牙语、印度尼西亚语、德语、巴西葡萄牙语、法语、泰语、越南语、马来语、菲律宾语、意大利语、俄语、荷兰语、波兰语、土耳其语、瑞典语），并支持使用 `[5.5s:8.0s]` 格式的时间戳进行逐句时序控制。`seed-audio-1.0` 模型仅支持英语和中文，不支持时序控制。

## 输出

| 输出名称    | 描述                                                            | 数据类型  |
| ------- | ------------------------------------------------------------- | ----- |
| `AUDIO` | 来自 ByteDance Seed Audio 1.0 的生成音频输出，包含提示词中描述的语音、音乐、音效或多说话人对话。 | AUDIO |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ByteDanceSeedAudio/zh.md)

***

**Source fingerprint (SHA-256):** `e86e4edde424b4427d864350a9d3b082e271fbd2b1e335175637a9cc3ad51163`
