基于视觉场景检测的高效视频到音频映射器
声音
2024-09-17 v1 多媒体
音频与语音处理
摘要
视频到音频(V2A)生成旨在给定无声视频输入,生成相应的音频。由于涉及跨模态和时序特征,这一任务尤其具有挑战性。最近的研究在弥合视频和音频之间的领域差异方面取得了显著进展,生成与视频内容语义对齐的音频。然而,这些方法的一个关键局限是无法有效识别和处理视频中多个场景,常导致此类情况下的次优音频生成。本文首先重新实现了一个最先进的V2A模型,采用稍微修改的轻量级架构,实现了超越基线的结果。我们随后提出了改进的V2A模型,纳入场景检测器,以解决在多个视觉场景之间切换的挑战。VGGSound上的结果表明,我们的模型能够识别和处理视频中的多个场景,对于保真度和相关性均优于基线。
引用
@article{arxiv.2409.09823,
title = {Efficient Video to Audio Mapper with Visual Scene Detection},
author = {Mingjing Yi and Ming Li},
journal= {arXiv preprint arXiv:2409.09823},
year = {2024}
}