AudioScopeV2:用于校准的开放域屏幕上声音分离的视听注意力架构
声音
2022-07-22 v1 计算机视觉与模式识别
音频与语音处理
摘要
我们提出 AudioScopeV2,一种最先进的通用视听屏幕上声音分离系统,其能够通过观看真实场景视频学习分离声音并将其与屏幕上物体相关联。我们指出了先前视听屏幕上声音分离工作的若干局限,包括时空注意力分辨率粗糙、音频分离模型收敛性差、训练与评估数据多样性有限,以及未能权衡屏幕上声音保留与屏外声音抑制。我们针对所有问题给出了解决方案。我们提出的跨模态与自注意力网络架构在更细的时间分辨率上捕捉视听依赖,同时还提出了高效的可分离变体,能够扩展到更长视频而不牺牲过多性能。我们还发现仅使用音频预训练分离模型可大幅改善结果。在训练与评估方面,我们从一个大型真实场景视频数据库(YFCC100M)中收集了屏幕上声音的新人工标注。该新数据集更具多样性与挑战性。最后,我们提出一种校准流程,可精确调节屏幕重建与屏外抑制的权衡,极大简化了不同工作点模型间性能的对比。总体而言,实验结果表明,在比先前方法更通用的条件下,我们的屏幕上分离性能取得显著改进,且额外计算复杂度极小。
引用
@article{arxiv.2207.10141,
title = {AudioScopeV2: Audio-Visual Attention Architectures for Calibrated Open-Domain On-Screen Sound Separation},
author = {Efthymios Tzinis and Scott Wisdom and Tal Remez and John R. Hershey},
journal= {arXiv preprint arXiv:2207.10141},
year = {2022}
}
备注
ECCV 2022