Skip to main content
MiniMax H3 Reference to Video 创建 MiniMax H3 参考视频生成所需的文本条件化数据和空音频-视频 latent。您需要提供提示词,以及可选的参考图像、视频和音频片段,节点会将这些参考编码为模型在生成时可以使用的条件化数据。提示词通过 <Picture i><Video k><Audio j> 标签引用这些参考。

输入

注意:
  • 提示词使用按类型从 1 开始的标签引用参考媒体:图像用 <Picture i>,视频用 <Video k>,音频用 <Audio j>。参考按固定顺序呈现给模型:图像,然后是视频(每个配乐的 <Audio j> 标签紧挨在其 <Video k> 之前),最后是独立音频。
  • 连接到 ref_video_audio_N 的配乐会与连接到 ref_video_N 的参考视频一起使用。
  • 参考视频必须包含至少 5 帧(24 fps 下约 0.2 秒),否则节点会报错。超出请求 length 的帧会被裁剪,剩余帧数会调整为模型支持的值。
  • 请求的 length 会在创建 latent 之前对齐到受支持的帧数。
  • 如果没有 vae,参考图像和视频只会对文本编码器进行条件化(不会生成参考 latent)。如果没有 audio_vae,参考音频只会对文本编码器进行条件化。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): 47df0d6d13cb02aa4f69b50a7f8d0f6c1639c1fb5e0f69bf8fc57dd4cb752db8