Rhythmic Foley:视频到音频合成中无缝视听对齐的框架
声音
2024-09-16 v1 多媒体
音频与语音处理
摘要
我们的研究引入了一个创新的视频到音频合成框架,解决了音频-视频不同步和音频语义丢失的问题。通过结合语义对齐适配器和时间同步适配器,我们的方法显著提高了语义完整性和节拍点同步的精度,尤其是在快节奏的动作序列中。利用对比视听预训练编码器,我们的模型使用视频和高质量音频数据进行训练,从而提高了生成音频的质量。这种双适配器方法使用户能够增强对音频语义和节拍效果的控制,允许调整控制器以获得更好的结果。大量实验证实了我们的框架在实现无缝视听对齐方面的有效性。
引用
@article{arxiv.2409.08628,
title = {Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis},
author = {Zhiqi Huang and Dan Luo and Jun Wang and Huan Liao and Zhiheng Li and Zhiyong Wu},
journal= {arXiv preprint arXiv:2409.08628},
year = {2024}
}