输入
注意:所有可选输入可以独立使用,也可以组合使用。节点会根据连接了哪些可选输入来修改提供的
positive 和 negative 条件化数据。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
b1148cd00d8999dd6842e3c2fb13655fda8f20d5befed975a6d1652688b2807cDocumentation Index
Fetch the complete documentation index at: /llms.txt
Use this file to discover all available pages before exploring further.
WanSoundImageToVideo 节点为 Wan 声音到视频生成准备条件化信息和一个空的 latent 视频张量。
| 参数 | 描述 | 数据类型 | 必需 | 范围 |
|---|---|---|---|---|
正面提示词 | 正向条件提示,指导生成视频中应出现的内容 | CONDITIONING | 是 | - |
负面提示词 | 负向条件提示,指定生成视频中应避免的内容 | CONDITIONING | 是 | - |
VAE | 用于将参考图像、运动参考和控制视频帧编码为 latent 表示的 VAE 模型 | VAE | 是 | - |
宽度 | 输出视频的宽度(像素)(默认值:832,步长:16) | INT | 是 | 16 to MAX_RESOLUTION |
高度 | 输出视频的高度(像素)(默认值:480,步长:16) | INT | 是 | 16 to MAX_RESOLUTION |
长度 | 生成视频的帧数(默认值:77,步长:4) | INT | 是 | 1 to MAX_RESOLUTION |
批次大小 | 同时生成的视频数量(默认值:1) | INT | 是 | 1 到 4096 |
音频编码器输出 | 可选的音频编码,可以根据声音特征影响视频生成。提供后,音频特征会被插值并用于条件化视频生成。 | AUDIO_ENCODER_OUTPUT | 否 | - |
参考图像 | 可选的参考图像,为视频内容提供视觉引导。该图像会被放大以匹配指定的宽度和高度,然后编码为 latent 表示。仅使用输入中的第一张图像作为参考。 | IMAGE | 否 | - |
控制视频 | 可选的控制视频,用于引导生成视频的运动和结构。该视频会被放大并编码,然后用于条件化输出。仅使用前 length 帧。 | IMAGE | 否 | - |
参考动作 | 可选的运动参考,为视频中的运动模式提供引导。如果输入超过 73 帧,则仅使用最后 73 帧。如果提供的帧数少于 73 帧,则使用中性帧填充序列。 | IMAGE | 否 | - |
positive 和 negative 条件化数据。
| 输出名称 | 描述 | 数据类型 |
|---|---|---|
positive | 处理后的正向条件化数据,已针对视频生成进行修改;当提供相应可选输入时,会包含音频嵌入、参考 latent、运动参考和控制视频条件化 | CONDITIONING |
negative | 处理后的负向条件化数据,已针对视频生成进行修改;当提供相应可选输入时,会包含音频嵌入(设置为零)、参考 latent、运动参考和控制视频条件化 | CONDITIONING |
latent | 用作生成起点的空 latent 视频张量。该 latent 张量的形状为 [batch_size, 16, latent_t, height/8, width/8],其中 latent_t 的计算方式为 ((length - 1) // 4) + 1。 | LATENT |
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
b1148cd00d8999dd6842e3c2fb13655fda8f20d5befed975a6d1652688b2807c