入力
注記:
start_image が提供される場合、画像シーケンスはターゲットの width と height にアップスケールされ、VAE でエンコードされて、潜在表現の先頭フレームに配置されます。これらのフレームのノイズマスクは 0(保持)に設定され、残りのフレームのマスク値は 1(ノイズ除去対象)になります。潜在表現は常に 48 チャンネル、空間次元は height / 16 × width / 16、時間次元は ((length - 1) // 4) + 1 です。width と height は 16 で割り切れる必要があり(ステップ 32 によって強制されます)、length は時間次元を 4 刻みで増加させます。
start_image が提供されない場合、完全に空の潜在表現がノイズマスクなしで返され、その空の潜在表現には batch_size 入力は適用されません。
出力
両方のフィールドは、単一の LATENT 出力内にまとめて返されます。
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集
Source fingerprint (SHA-256):
3d05980641eeef2e86df7a845aa8b2bd703882db98fe71adef2746ab34a9d717