Skip to main content
ByteDance Seed Audio 1.0 で、単一のプロンプトから音声、音楽、効果音、複数話者の対話を生成します。プロンプト内で声、感情、環境音、BGM、効果音を記述し、話すセリフを含めます。必要に応じて、組み込みのプリセットボイスを選択するか、最大3つの参照クリップ(プロンプト内で @Audio1-3 としてタグ付け)から声をクローンするか、キャラクター画像から声を導出できます。1回の実行につき最大2分の音声。多言語モデルは20言語とタイムスタンプベースのタイミング制御をサポートします。

入力

パラメータ制約

  • 参照モードの依存関係: reference_mode パラメータは、他にどの入力が必要かを決定します:
    • “text only”: 追加の入力は不要です。プロンプトに @AudioN タグを含めることはできません。
    • “audio reference”: reference_audio_1reference_audio_2reference_audio_3 の少なくとも1つが接続されている必要があります。参照クリップは隙間なく順番に接続する必要があります。各クリップの最大長は30秒です。プロンプトで @AudioN タグを使用する場合、最も大きいタグ番号は接続された参照クリップ数を超えてはいけません。
    • “image reference”: reference_image が接続されている必要があります。@AudioN タグは使用しません。プロンプトには合成するテキストのみを含めてください。
    • “preset voice”: プリセットボイスを選択する必要があります。プロンプト全体が選択したボイスで読み上げられます。@AudioN タグは参照として使用されず、@Audio2 以上のタグは拒否されます。
  • 音声参照の順序: 「audio reference」モードでは、参照音声入力は reference_audio_1 から始めて隙間なく順番に接続する必要があります。たとえば、reference_audio_1reference_audio_2 は接続できますが、reference_audio_2 なしで reference_audio_1reference_audio_3 は接続できません。
  • 最大音声タグ数: 「audio reference」モードでは、最大3つの参照クリップ(@Audio1、@Audio2、@Audio3)を接続でき、プロンプト内の最も大きい @AudioN タグは、接続された参照音声入力数を超えてはいけません。
  • モデルの違い: seed-audio-1.0-multilingual モデルは20言語(英語、中国語、日本語、韓国語、メキシコスペイン語とカスティーリャスペイン語、インドネシア語、ドイツ語、ブラジルポルトガル語、フランス語、タイ語、ベトナム語、マレー語、フィリピノ語、イタリア語、ロシア語、オランダ語、ポーランド語、トルコ語、スウェーデン語)と、[5.5s:8.0s] 形式のタイムスタンプを使用した文単位のタイミング制御をサポートします。seed-audio-1.0 モデルは英語と中国語のみをサポートし、タイミング制御はありません。

出力

このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集

Source fingerprint (SHA-256): e86e4edde424b4427d864350a9d3b082e271fbd2b1e335175637a9cc3ad51163