> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-comfy-docs-comfyapi-search.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# WanSoundImageToVideo - ComfyUI Built-in Node Documentation

> WanSoundImageToVideo 节点为 Wan 声音到视频生成准备条件化信息和一个空的 latent 视频张量。

WanSoundImageToVideo 节点为 Wan 声音到视频生成准备条件化信息和一个空的 latent 视频张量。它可以选择性地整合音频编码、参考图像、控制视频和运动参考，以引导生成的视频。

## 输入

| 参数        | 描述                                                                       | 数据类型                   | 必需 | 范围                    |
| --------- | ------------------------------------------------------------------------ | ---------------------- | -- | --------------------- |
| `正面提示词`   | 正向条件提示，指导生成视频中应出现的内容                                                     | CONDITIONING           | 是  | -                     |
| `负面提示词`   | 负向条件提示，指定生成视频中应避免的内容                                                     | CONDITIONING           | 是  | -                     |
| `VAE`     | 用于将参考图像、运动参考和控制视频帧编码为 latent 表示的 VAE 模型                                  | VAE                    | 是  | -                     |
| `宽度`      | 输出视频的宽度（像素）（默认值：832，步长：16）                                               | INT                    | 是  | 16 to MAX\_RESOLUTION |
| `高度`      | 输出视频的高度（像素）（默认值：480，步长：16）                                               | INT                    | 是  | 16 to MAX\_RESOLUTION |
| `长度`      | 生成视频的帧数（默认值：77，步长：4）                                                     | INT                    | 是  | 1 to MAX\_RESOLUTION  |
| `批次大小`    | 同时生成的视频数量（默认值：1）                                                         | INT                    | 是  | 1 到 4096              |
| `音频编码器输出` | 可选的音频编码，可以根据声音特征影响视频生成。提供后，音频特征会被插值并用于条件化视频生成。                           | AUDIO\_ENCODER\_OUTPUT | 否  | -                     |
| `参考图像`    | 可选的参考图像，为视频内容提供视觉引导。该图像会被放大以匹配指定的宽度和高度，然后编码为 latent 表示。仅使用输入中的第一张图像作为参考。 | IMAGE                  | 否  | -                     |
| `控制视频`    | 可选的控制视频，用于引导生成视频的运动和结构。该视频会被放大并编码，然后用于条件化输出。仅使用前 `length` 帧。             | IMAGE                  | 否  | -                     |
| `参考动作`    | 可选的运动参考，为视频中的运动模式提供引导。如果输入超过 73 帧，则仅使用最后 73 帧。如果提供的帧数少于 73 帧，则使用中性帧填充序列。 | IMAGE                  | 否  | -                     |

注意：所有可选输入可以独立使用，也可以组合使用。节点会根据连接了哪些可选输入来修改提供的 `positive` 和 `negative` 条件化数据。

## 输出

| 输出名称       | 描述                                                                                                                                   | 数据类型         |
| ---------- | ------------------------------------------------------------------------------------------------------------------------------------ | ------------ |
| `positive` | 处理后的正向条件化数据，已针对视频生成进行修改；当提供相应可选输入时，会包含音频嵌入、参考 latent、运动参考和控制视频条件化                                                                    | CONDITIONING |
| `negative` | 处理后的负向条件化数据，已针对视频生成进行修改；当提供相应可选输入时，会包含音频嵌入（设置为零）、参考 latent、运动参考和控制视频条件化                                                              | CONDITIONING |
| `latent`   | 用作生成起点的空 latent 视频张量。该 latent 张量的形状为 `[batch_size, 16, latent_t, height/8, width/8]`，其中 `latent_t` 的计算方式为 `((length - 1) // 4) + 1`。 | LATENT       |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/WanSoundImageToVideo/zh.md)

***

**Source fingerprint (SHA-256):** `b1148cd00d8999dd6842e3c2fb13655fda8f20d5befed975a6d1652688b2807c`
