入力
パラメータ制約
-
参照モードの依存関係:
reference_modeパラメータは、他にどの入力が必要かを決定します:- “text only”: 追加の入力は不要です。プロンプトに @AudioN タグを含めることはできません。
- “audio reference”:
reference_audio_1、reference_audio_2、reference_audio_3の少なくとも1つが接続されている必要があります。参照クリップは隙間なく順番に接続する必要があります。各クリップの最大長は30秒です。プロンプトで @AudioN タグを使用する場合、最も大きいタグ番号は接続された参照クリップ数を超えてはいけません。 - “image reference”:
reference_imageが接続されている必要があります。@AudioN タグは使用しません。プロンプトには合成するテキストのみを含めてください。 - “preset voice”: プリセットボイスを選択する必要があります。プロンプト全体が選択したボイスで読み上げられます。@AudioN タグは参照として使用されず、@Audio2 以上のタグは拒否されます。
-
音声参照の順序: 「audio reference」モードでは、参照音声入力は
reference_audio_1から始めて隙間なく順番に接続する必要があります。たとえば、reference_audio_1とreference_audio_2は接続できますが、reference_audio_2なしでreference_audio_1とreference_audio_3は接続できません。 - 最大音声タグ数: 「audio reference」モードでは、最大3つの参照クリップ(@Audio1、@Audio2、@Audio3)を接続でき、プロンプト内の最も大きい @AudioN タグは、接続された参照音声入力数を超えてはいけません。
-
モデルの違い:
seed-audio-1.0-multilingualモデルは20言語(英語、中国語、日本語、韓国語、メキシコスペイン語とカスティーリャスペイン語、インドネシア語、ドイツ語、ブラジルポルトガル語、フランス語、タイ語、ベトナム語、マレー語、フィリピノ語、イタリア語、ロシア語、オランダ語、ポーランド語、トルコ語、スウェーデン語)と、[5.5s:8.0s]形式のタイムスタンプを使用した文単位のタイミング制御をサポートします。seed-audio-1.0モデルは英語と中国語のみをサポートし、タイミング制御はありません。
出力
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集
Source fingerprint (SHA-256):
e86e4edde424b4427d864350a9d3b082e271fbd2b1e335175637a9cc3ad51163