Skip to main content
このノードは、画像とテキストをエンコードしてトレーニング用データを準備します。画像のリストと、それに対応するテキストキャプションのリストを受け取り、VAE モデルを使用して画像を潜在表現に変換し、CLIP モデルを使用してテキストをコンディショニングデータに変換します。得られたペアの潜在表現とコンディショニングはリストとして出力され、トレーニングワークフローで使用できる状態になります。

入力

パラメータの制約:
  • このノードはリスト入力を使用します。imagestexts はリストとして処理され、vaeclip はそれぞれ単一のモデルを受け付けます(指定されたリストの最初の項目が使用されます)。
  • texts リストの項目数は、0、1、または images リストの項目数と完全に一致している必要があります。0 または省略の場合、すべての画像に空文字列が使用されます。1 の場合、その単一のテキストがすべての画像に対して繰り返されます。それ以外の長さではエラーが発生します。
  • 出力 latentsconditioning のリストは常に images リストと同じ数の項目を含みます。そのため、各 latent は対応するキャプションの conditioning とペアになります。

出力

このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集

Source fingerprint (SHA-256): 244adc98810a874cfe42f834e89f96da300d883faeb5791dff19607c13d0c0db