入力
注:
clip_vision_output は、完全な隠れ状態と最後から2番目の隠れ状態を提供する CLIP vision モデルから取得する必要があります。このノードは、最後から20番目、最後から11番目、および最後から2番目の隠れ状態をスタイル埋め込みに結合します。model_patch は、その model 属性を通じて投影モデルを公開する必要があり、この投影モデルがこれらの画像特徴量をスタイル埋め込みに変換します。サンプリング中、スタイル埋め込みはテキストコンディショニングの先頭に追加され、生成に影響を与えられるようになります。また、一致するゼロ位置のテキストIDがテキストIDの先頭に追加され、識別子シーケンスが拡張コンディショニングと整合した状態に保たれます。
出力
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集
Source fingerprint (SHA-256):
9033dddb76fafb388c67dcd09d96102a7ab3e5bc416cec61bf18d088da37a0f0