width、height、length 和 batch_size 创建相应大小的零填充 latent。
输入
注意: 当提供参考图像时,批次中的第一张图像会使用双线性插值上采样到请求的
width 和 height,并使用 VAE 编码。该参考 latent 会附加到正向条件,而相同形状的零填充 latent 会附加到负向条件。当提供 audio_encoder_output 时,音频嵌入会被插值并附加到正向条件,而零填充音频嵌入会附加到负向条件。如果省略任一可选输入,则会使用零填充占位张量:形状为 [batch_size, 16, 1, height // 8, width // 8] 的零参考 latent 和/或形状为 [batch_size, latent_t + 1, 8, 5, 1280] 的零音频嵌入,其中 latent_t = ((length - 1) // 4) + 1。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
db674a4a00729a8715988030083e2858f958cd21de73bbbe4ed6d76f5f539419