Skip to main content
LTXVImgToVideo は、入力画像を動画生成モデル用の動画潜在表現に変換します。要求された幅と高さに画像をリサイズし、VAE でエンコードし、エンコードされたフレームを、ゼロで埋められた動画サイズの潜在表現の先頭に配置します。strength コントロールは、動画生成中に元の画像内容がどれだけ保持されるか、または変更されるかを決定します。

入力

注: widthheight は 32 ピクセル単位で変化し、length は 8 フレーム単位で変化します。これは動画潜在表現の圧縮(空間次元で 32 倍、時間次元で 8 倍)に対応しています。動画潜在表現には ((length - 1) // 8) + 1 フレームが含まれます。入力画像はバイリニアスケーリングと中央クロッピングを使用して width x height にリサイズされ、エンコードには最初の 3 チャンネルのみが使用されます。

出力

このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集

Source fingerprint (SHA-256): 4ebc7f80b4d9ac3329e3349c7048885de22b827b5bdd102976687afd7e07a16b