> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-comfy-docs-comfyapi-search.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMaxH3ReferenceToVideo - ComfyUI Built-in Node Documentation

> MiniMax H3 Reference to Video 创建 MiniMax H3 参考视频生成所需的文本条件化数据和空音频-视频 latent。

MiniMax H3 Reference to Video 创建 MiniMax H3 参考视频生成所需的文本条件化数据和空音频-视频 latent。您需要提供提示词，以及可选的参考图像、视频和音频片段，节点会将这些参考编码为模型在生成时可以使用的条件化数据。提示词通过 `<Picture i>`、`<Video k>` 和 `<Audio j>` 标签引用这些参考。

## 输入

| 参数          | 描述                                                                                                                                 | 数据类型   | 必需 | 范围                     |
| ----------- | ---------------------------------------------------------------------------------------------------------------------------------- | ------ | -- | ---------------------- |
| `clip`      | 用于对提示词进行分词，并将参考媒体编码为条件化 token 的 CLIP 模型。                                                                                           | CLIP   | 是  |                        |
| `vae`       | 视频 VAE。没有它时，参考图像/视频只会对文本编码器进行条件化。                                                                                                  | VAE    | 否  |                        |
| `audio_vae` | 音频 VAE。没有它时，参考音频只会对文本编码器进行条件化。                                                                                                     | VAE    | 否  |                        |
| `提示词`       | 视频的文本提示词。可以使用 `<Picture i>`、`<Video k>` 和 `<Audio j>` 标签引用参考媒体（按类型从 1 开始）。支持多行和动态提示词。                                              | STRING | 是  |                        |
| `宽度`        | 生成视频的宽度（像素，默认：1344）。                                                                                                               | INT    | 是  | 32 到 16384 （步长：32）     |
| `高度`        | 生成视频的高度（像素，默认：768）。                                                                                                                | INT    | 是  | 32 到 16384 （步长：32）     |
| `长度`        | 24 fps 下的帧数（124 = 约 5 秒，训练范围为约 124-362）（默认：124）。                                                                                   | INT    | 是  | 5 到 3600 （步长：17）       |
| `参考图像尺寸`    | 参考图像尺寸调整。`match` 会将每个参考图像（仅缩小，保持宽高比）缩放到生成目标的像素面积；`max` 使用参考管线的 2048px 短边，以获得最佳身份保真度。参考 token 会经过每个采样步骤，因此 `max` 可能慢数倍（默认：`match`）。 | COMBO  | 是  | `"match"`<br />`"max"` |
| `参考图像`      | 可增长槽位：最多连接 9 张参考图像（`ref_image_1` ... `ref_image_9`）。参考图像（如果更大则下采样到 2048 短边，不会放大）。                                                  | IMAGE  | 否  | 0 到 9                  |
| `参考视频`      | 可增长槽位：最多连接 3 个参考视频（`ref_video_1` ... `ref_video_3`）。参考视频帧率为 24 fps（2-15 秒）。                                                        | IMAGE  | 否  | 0 到 3                  |
| `参考视频音频`    | 可增长槽位：最多连接 3 条配乐（`ref_video_audio_1` ... `ref_video_audio_3`）。与编号相同的参考视频对应的配乐。                                                     | AUDIO  | 否  | 0 到 3                  |
| `参考音频`      | 可增长槽位：最多连接 3 个独立参考音频片段（`ref_audio_1` ... `ref_audio_3`）。独立参考音频。                                                                    | AUDIO  | 否  | 0 到 3                  |

注意：

* 提示词使用按类型从 1 开始的标签引用参考媒体：图像用 `<Picture i>`，视频用 `<Video k>`，音频用 `<Audio j>`。参考按固定顺序呈现给模型：图像，然后是视频（每个配乐的 `<Audio j>` 标签紧挨在其 `<Video k>` 之前），最后是独立音频。
* 连接到 `ref_video_audio_N` 的配乐会与连接到 `ref_video_N` 的参考视频一起使用。
* 参考视频必须包含至少 5 帧（24 fps 下约 0.2 秒），否则节点会报错。超出请求 `length` 的帧会被裁剪，剩余帧数会调整为模型支持的值。
* 请求的 `length` 会在创建 latent 之前对齐到受支持的帧数。
* 如果没有 `vae`，参考图像和视频只会对文本编码器进行条件化（不会生成参考 latent）。如果没有 `audio_vae`，参考音频只会对文本编码器进行条件化。

## 输出

| 输出名称       | 描述                                                                              | 数据类型         |
| ---------- | ------------------------------------------------------------------------------- | ------------ |
| `positive` | 包含编码后提示词的条件化数据。当提供了参考媒体和相关的 VAE 时，它还包含 MiniMax H3 模型使用的编码后的参考图像、视频和音频内容。        | CONDITIONING |
| `latent`   | 在请求的 `width`、`height` 和 `length`（帧数）下的空音频-视频 latent，包括对齐后的视频 latent 和音频 latent。 | LATENT       |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/MiniMaxH3ReferenceToVideo/zh.md)

***

**Source fingerprint (SHA-256):** `47df0d6d13cb02aa4f69b50a7f8d0f6c1639c1fb5e0f69bf8fc57dd4cb752db8`
