中文

利用音视觉自注意力改进开放域视频的屏内声音分离

声音 2021-10-15 v2 计算机视觉与模式识别 机器学习

摘要

我们提出了一种最先进的音视觉屏内声音分离系统,该系统能够通过观看真实场景(in-the-wild)视频来学习分离声音并将其与屏内物体相关联。我们指出了先前音视觉屏内声音分离工作的局限性,包括时空注意力的简单性与粗分辨率,以及音频分离模型收敛性差。我们提出的模型通过使用跨模态与自注意力模块在更细的时间分辨率上捕捉音视觉依赖关系,以及对音频分离模型进行无监督预训练,解决了这些问题。这些改进使模型能够泛化到更广泛的一组未见过的视频。我们还展示了一种鲁棒的方法,通过使用少量标注了屏内存在的同域视频来校准音视觉屏内分类器的概率,从而进一步提升模型的泛化能力。为评估和半监督训练,我们从大型真实场景视频数据库(YFCC100m)中收集了屏内音频的人工标注。我们的结果显示,在比先前方法更通用的条件下,屏内分离性能有显著改善。

关键词

引用

@article{arxiv.2106.09669,
  title  = {Improving On-Screen Sound Separation for Open-Domain Videos with Audio-Visual Self-Attention},
  author = {Efthymios Tzinis and Scott Wisdom and Tal Remez and John R. Hershey},
  journal= {arXiv preprint arXiv:2106.09669},
  year   = {2021}
}