输入
注意: 当提供 VAE 时,该节点会根据所有提供的输入图像生成参考 latent。一次最多可处理三张图像。用于视觉-语言处理时,图像会被缩放到目标面积 384x384 像素(保持宽高比);用于 VAE 编码时,则会缩放到能被 8 整除的尺寸(目标面积 1024x1024 像素)。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
5eea53a84045924b44d445244e6149b341188d22573aaaced87bac8a139dac96