> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-comfy-docs-comfyapi-search.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# ByteDanceSeedAudio - ComfyUI Built-in Node Documentation

> ByteDance Seed Audio 1.0 で、単一のプロンプトから音声、音楽、効果音、複数話者の対話を生成します。

ByteDance Seed Audio 1.0 で、単一のプロンプトから音声、音楽、効果音、複数話者の対話を生成します。プロンプト内で声、感情、環境音、BGM、効果音を記述し、話すセリフを含めます。必要に応じて、組み込みのプリセットボイスを選択するか、最大3つの参照クリップ（プロンプト内で @Audio1-3 としてタグ付け）から声をクローンするか、キャラクター画像から声を導出できます。1回の実行につき最大2分の音声。多言語モデルは20言語とタイムスタンプベースのタイミング制御をサポートします。

## 入力

| パラメータ               | 説明                                                                                                                                                                                                                                                               | データ型   | 必須  | 範囲                                                                                    |
| ------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------ | --- | ------------------------------------------------------------------------------------- |
| `text_prompt`       | 声、感情、話す速さ、環境音、BGM、効果音を記述し、話すセリフを含めます（対話ではインラインでキャラクター名を指定します）。「audio reference」モードでは、接続されたクリップを順番に @Audio1、@Audio2、@Audio3 として参照します。多言語モデルでは、引用したセリフの先頭にタイムスタンプ範囲を付けて、話すタイミングと長さを制御できます（例：`[5.5s:8.0s] Wait for me!`）。プロンプトは、話すセリフと同じ言語で記述してください。最小1文字、最大3000文字。 | STRING | はい  | 1～3000文字                                                                              |
| `reference_mode`    | 声をどのように条件付けするか：「text only」（すべてをプロンプトで記述）、「audio reference」（最大3つの声をクローンし、@Audio1-3 としてタグ付け）、「image reference」（1枚のキャラクター画像から声を導出）、または「preset voice」（プロンプトを読み上げる組み込みの名前付きボイスを選択）。                                                                                   | COMBO  | はい  | `"text only"`<br />`"audio reference"`<br />`"image reference"`<br />`"preset voice"` |
| `reference_audio_1` | 音声クローン用の参照クリップ。プロンプト内で @Audio1 としてタグ付けします。最大30秒。`reference_mode` が「audio reference」の場合のみ使用できます。                                                                                                                                                                  | AUDIO  | いいえ | 最大30秒                                                                                 |
| `reference_audio_2` | プロンプト内で @Audio2 としてタグ付けされる参照クリップ。最大30秒。`reference_mode` が「audio reference」の場合のみ使用できます。                                                                                                                                                                           | AUDIO  | いいえ | 最大30秒                                                                                 |
| `reference_audio_3` | プロンプト内で @Audio3 としてタグ付けされる参照クリップ。最大30秒。`reference_mode` が「audio reference」の場合のみ使用できます。                                                                                                                                                                           | AUDIO  | いいえ | 最大30秒                                                                                 |
| `reference_image`   | 1枚のキャラクター画像。モデルはそれから声を導出します。参照音声とは併用できません。`reference_mode` が「image reference」の場合のみ使用できます。                                                                                                                                                                        | IMAGE  | いいえ | -                                                                                     |
| `preset_voice`      | プロンプトを読み上げる組み込みの TTS 2.0 ボイス。参照クリップは不要で、このモードでは @AudioN タグは使用されません。`reference_mode` が「preset voice」の場合に必須です。                                                                                                                                                     | COMBO  | いいえ | 複数の組み込みプリセットボイスオプション（デフォルトでは最初のオプションが選択されます）                                          |
| `sample_rate`       | 出力サンプルレート（Hz）。（デフォルト："24000"）                                                                                                                                                                                                                                    | COMBO  | はい  | `"8000"`<br />`"16000"`<br />`"24000"`<br />`"32000"`<br />`"44100"`<br />`"48000"`   |
| `speech_rate`       | 話す速度。0 = 通常、100 = 2.0倍、-50 = 0.5倍。（デフォルト：0）                                                                                                                                                                                                                      | INT    | はい  | -50～100                                                                               |
| `loudness_rate`     | 音量。0 = 通常、100 = 2.0倍、-50 = 0.5倍。（デフォルト：0）                                                                                                                                                                                                                        | INT    | はい  | -50～100                                                                               |
| `pitch_rate`        | 半音単位のピッチシフト（-12～12）。（デフォルト：0）                                                                                                                                                                                                                                    | INT    | はい  | -12～12                                                                                |
| `seed`              | シードはノードを再実行するかどうかを制御します。シードに関係なく結果は非決定的です。（デフォルト：42）                                                                                                                                                                                                             | INT    | はい  | 0～2147483647                                                                          |
| `model`             | モデルバージョン。`seed-audio-1.0-multilingual` は20言語と、`[5.5s:8.0s]` タイムスタンプによる文単位のタイミング制御をサポートします。`seed-audio-1.0` は英語と中国語のみをサポートし、タイミング制御はありません。（デフォルト："seed-audio-1.0-multilingual"）                                                                                   | COMBO  | いいえ | `"seed-audio-1.0-multilingual"`<br />`"seed-audio-1.0"`                               |

### パラメータ制約

* **参照モードの依存関係**: `reference_mode` パラメータは、他にどの入力が必要かを決定します：
  * **"text only"**: 追加の入力は不要です。プロンプトに @AudioN タグを含めることはできません。
  * **"audio reference"**: `reference_audio_1`、`reference_audio_2`、`reference_audio_3` の少なくとも1つが接続されている必要があります。参照クリップは隙間なく順番に接続する必要があります。各クリップの最大長は30秒です。プロンプトで @AudioN タグを使用する場合、最も大きいタグ番号は接続された参照クリップ数を超えてはいけません。
  * **"image reference"**: `reference_image` が接続されている必要があります。@AudioN タグは使用しません。プロンプトには合成するテキストのみを含めてください。
  * **"preset voice"**: プリセットボイスを選択する必要があります。プロンプト全体が選択したボイスで読み上げられます。@AudioN タグは参照として使用されず、@Audio2 以上のタグは拒否されます。

* **音声参照の順序**: 「audio reference」モードでは、参照音声入力は `reference_audio_1` から始めて隙間なく順番に接続する必要があります。たとえば、`reference_audio_1` と `reference_audio_2` は接続できますが、`reference_audio_2` なしで `reference_audio_1` と `reference_audio_3` は接続できません。

* **最大音声タグ数**: 「audio reference」モードでは、最大3つの参照クリップ（@Audio1、@Audio2、@Audio3）を接続でき、プロンプト内の最も大きい @AudioN タグは、接続された参照音声入力数を超えてはいけません。

* **モデルの違い**: `seed-audio-1.0-multilingual` モデルは20言語（英語、中国語、日本語、韓国語、メキシコスペイン語とカスティーリャスペイン語、インドネシア語、ドイツ語、ブラジルポルトガル語、フランス語、タイ語、ベトナム語、マレー語、フィリピノ語、イタリア語、ロシア語、オランダ語、ポーランド語、トルコ語、スウェーデン語）と、`[5.5s:8.0s]` 形式のタイムスタンプを使用した文単位のタイミング制御をサポートします。`seed-audio-1.0` モデルは英語と中国語のみをサポートし、タイミング制御はありません。

## 出力

| 出力名     | 説明                                                                           | データ型  |
| ------- | ---------------------------------------------------------------------------- | ----- |
| `AUDIO` | ByteDance Seed Audio 1.0 によって生成された音声出力。プロンプトで記述された音声、音楽、効果音、または複数話者の対話を含みます。 | AUDIO |

> このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください！ [GitHub で編集](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ByteDanceSeedAudio/ja.md)

***

**Source fingerprint (SHA-256):** `e86e4edde424b4427d864350a9d3b082e271fbd2b1e335175637a9cc3ad51163`
