Skip to main content
Wan22ImageToVideoLatent は、画像から動画の潜在表現を生成します。指定された幅、高さ、フレーム長、バッチサイズで空の動画潜在空間を生成し、必要に応じて開始画像シーケンスを先頭フレームにエンコードできます。開始画像が提供されると、ノードはそれを潜在空間にエンコードし、生成時にノイズ除去すべき領域を示す対応するノイズマスクを作成します。

入力

注記: start_image が提供される場合、画像シーケンスはターゲットの widthheight にアップスケールされ、VAE でエンコードされて、潜在表現の先頭フレームに配置されます。これらのフレームのノイズマスクは 0(保持)に設定され、残りのフレームのマスク値は 1(ノイズ除去対象)になります。潜在表現は常に 48 チャンネル、空間次元は height / 16 × width / 16、時間次元は ((length - 1) // 4) + 1 です。widthheight は 16 で割り切れる必要があり(ステップ 32 によって強制されます)、length は時間次元を 4 刻みで増加させます。 start_image が提供されない場合、完全に空の潜在表現がノイズマスクなしで返され、その空の潜在表現には batch_size 入力は適用されません。

出力

両方のフィールドは、単一の LATENT 出力内にまとめて返されます。
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集

Source fingerprint (SHA-256): 3d05980641eeef2e86df7a845aa8b2bd703882db98fe71adef2746ab34a9d717