HunyuanVideo-Foley:基于表示对齐的多模态扩散用于高保真无声音生成
音频与语音处理
2025-08-26 v1 计算机视觉与模式识别
声音
摘要
最近的视频生成技术产生了逼真的视觉内容,但缺乏同步音频严重削弱了沉浸感。为解决视频到音频生成中的关键挑战,包括多模态数据稀缺、模态不平衡以及现有方法中音频质量有限,我们提出 HunyuanVideo-Foley,一个 end-to-end 从文本-视频到音频的框架,用于合成与视觉动态和语境精确对齐的高保真音频。我们的方法包含三个核心创新:(1) 一个可扩展的数据管道,通过自动标注筛选 100k 小时多模态数据集;(2) 一种表示对齐策略使用自监督音频特征指导潜在扩散训练,高效提高音频质量和生成稳定性;(3) 一个解决模态竞争的新型多模态扩散变换器,包含通过联合注意力实现的双流音频-视频融合,并通过交叉注意力实现文本语义注入。全面评估表明,HunyuanVideo-Foley 在音频保真度、视觉-语义对齐、时间对齐和分布匹配方面实现了新的最佳性能。演示页面可在:https://szczesnys.github.io/hunyuanvideo-foley/ 查看。
引用
@article{arxiv.2508.16930,
title = {HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation},
author = {Sizhe Shan and Qiulin Li and Yutao Cui and Miles Yang and Yuehai Wang and Qun Yang and Jin Zhou and Zhao Zhong},
journal= {arXiv preprint arXiv:2508.16930},
year = {2025}
}