利用自监督运动表征的视觉引导声源分离与定位
计算机视觉与模式识别
2021-04-20 v1
摘要
本文的目标是进行音视觉声源分离,即基于声源视频从混合音频中分离出各成分音频。此外,我们旨在定位输入视频序列中的声源位置。近期工作在使用源类型先验知识(如人演奏乐器)和预训练运动检测器(如关键点或光流)时展示了令人印象深刻的音视觉分离结果。然而,这些模型同时被限制于特定应用领域。本文针对这些局限做出贡献如下:i) 我们提出称为外观与运动网络(AMnet)的两阶段架构,两阶段分别专注于外观与运动线索。整个系统以自监督方式训练;ii) 我们引入音频-运动嵌入(AME)框架,以显式表示与声音相关的运动;iii) 我们提出用于音频与运动特征融合的音频-运动Transformer架构;iv) 尽管未使用任何预训练关键点检测器或光流估计器,我们在两个具挑战性数据集(MUSIC-21 和 AVE)上展示了最先进的性能。项目主页:https://ly-zhu.github.io/self-supervised-motion-representations
引用
@article{arxiv.2104.08506,
title = {Visually Guided Sound Source Separation and Localization using Self-Supervised Motion Representations},
author = {Lingyu Zhu and Esa Rahtu},
journal= {arXiv preprint arXiv:2104.08506},
year = {2021}
}
备注
18 pages. main paper: 8 pages; reference: 2 pages; supplementary material: 8 pages