Skip to main content
TextEncodeZImageOmni 将文本提示词与最多三张可选参考图像一起编码为图像生成模型的条件格式。提示词会使用 CLIP 模型进行分词和编码,每张连接的图像可以选择性地由视觉编码器和/或 VAE 处理,从而将视觉参考与文本一起嵌入。此节点标记为实验性。

输入

注意: 节点最多接受三张图像(image1image2image3)。仅当至少提供一张图像时,才会使用 image_encodervae 输入;当两者都连接时,每张图像都会由两者处理。当 auto_resize_images 为 True 且连接了 vae 时,图像会在编码前调整为总像素面积接近 1024x1024。如果未提供图像,则仅编码文本提示词。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): b40a3150f536b6f37e2b53e6d9992fcb4fd32dceb540c0a76773a7ba1af9a7b8