Skip to main content
LTXV Reference Audio 将说话人的语音身份从参考音频片段迁移到生成的音频中。它将参考音频编码到条件化数据中,并可选地通过身份引导来修补模型,该引导会在每一步执行一次不包含参考音频的额外前向传递,以增强说话人身份效果。

输入

注意:仅当 identity_guidance_scale 大于 0 且当前采样步骤位于 start_percentend_percent 定义的范围内时,才会应用身份引导。如果参考音频与音频 VAE 的采样率不同,则会将参考音频重采样为音频 VAE 的采样率。 注意:start_percentend_percent 是高级参数,仅当界面中启用了高级选项时才会显示。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): ae15c5838656324667d099614b325b863341f05afda43054658999574522dd49