中文

Rhythmic Foley:视频到音频合成中无缝视听对齐的框架

声音 2024-09-16 v1 多媒体 音频与语音处理

摘要

我们的研究引入了一个创新的视频到音频合成框架,解决了音频-视频不同步和音频语义丢失的问题。通过结合语义对齐适配器和时间同步适配器,我们的方法显著提高了语义完整性和节拍点同步的精度,尤其是在快节奏的动作序列中。利用对比视听预训练编码器,我们的模型使用视频和高质量音频数据进行训练,从而提高了生成音频的质量。这种双适配器方法使用户能够增强对音频语义和节拍效果的控制,允许调整控制器以获得更好的结果。大量实验证实了我们的框架在实现无缝视听对齐方面的有效性。

关键词

引用

@article{arxiv.2409.08628,
  title  = {Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis},
  author = {Zhiqi Huang and Dan Luo and Jun Wang and Huan Liao and Zhiheng Li and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2409.08628},
  year   = {2024}
}