Skip to main content
WanHuMoImageToVideo 节点为 Wan HuMo 视频生成流程准备条件数据和一个空 latent 视频。它可以将参考图像和音频嵌入附加到正向和负向条件输入,并根据请求的 widthheightlengthbatch_size 创建相应大小的零填充 latent。

输入

注意: 当提供参考图像时,批次中的第一张图像会使用双线性插值上采样到请求的 widthheight,并使用 VAE 编码。该参考 latent 会附加到正向条件,而相同形状的零填充 latent 会附加到负向条件。当提供 audio_encoder_output 时,音频嵌入会被插值并附加到正向条件,而零填充音频嵌入会附加到负向条件。如果省略任一可选输入,则会使用零填充占位张量:形状为 [batch_size, 16, 1, height // 8, width // 8] 的零参考 latent 和/或形状为 [batch_size, latent_t + 1, 8, 5, 1280] 的零音频嵌入,其中 latent_t = ((length - 1) // 4) + 1

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): db674a4a00729a8715988030083e2858f958cd21de73bbbe4ed6d76f5f539419