中文

通过观看电影学习高亮音频

计算机视觉与模式识别 2025-05-20 v1 声音 音频与语音处理

摘要

近年来,视频内容的创作和消费量显著增加。精心策划的内容需要仔细选取视觉元素和音频元素的配合。虽然通过最佳视角选择或后期编辑等技术进行的视觉线索策划一直是媒体制作的核心,但其自然对应——音频——的发展不及人所及。这常常导致视觉和声学显著性之间的脱节。为弥合这一差距,我们提出了一种新任务:视觉引导的声学高亮化,用以引导音频呈现适当的高亮效果,从而创建更和谐的音视频体验。我们提出了一种灵活的基于 transformer 的多模态框架来解决此任务。为训练模型,我们引入了新数据集——muddy mix 数据集,利用电影中严谨的音频和视频策划,提供一种形式的免费监督。我们开发了伪数据生成流程,通过分离、调整和重新混音三个步骤来模拟较差混合音频,模拟真实场景。我们的方法在定量和主观评估中 consistently 优于多个基线方法。我们还系统研究了不同类型的上下文引导和数据集难度级别的影响。我们的项目页面在此:https://wikichao.github.io/VisAH/。

关键词

引用

@article{arxiv.2505.12154,
  title  = {Learning to Highlight Audio by Watching Movies},
  author = {Chao Huang and Ruohan Gao and J. M. F. Tsang and Jan Kurcius and Cagdas Bilen and Chenliang Xu and Anurag Kumar and Sanjeel Parekh},
  journal= {arXiv preprint arXiv:2505.12154},
  year   = {2025}
}

备注

CVPR 2025. Project page: https://wikichao.github.io/VisAH/