中文

借助AudioScope深入真实场景:屏幕内声音的无监督音视频分离

声音 2021-06-01 v2 计算机视觉与模式识别 音频与语音处理

摘要

深度学习近期的进展推动了声音分离与视觉场景理解的诸多发展。然而,从自然视频中提取显而易见声源仍是一个开放问题。本工作中,我们提出AudioScope,一种新颖的音视频声音分离框架,可在无监督下训练,从真实野外视频中隔离屏幕内声源。先前的音视频分离工作对声类域施加了人为限制(例如限于语音或音乐),约束了源数量,且需要强声音分离或视觉分割标签。AudioScope克服了这些局限,在开放声类域上运行,源数量可变,且无需标签或先验视觉分割。AudioScope的训练过程使用混合不变训练(MixIT)将合成混合之混合(MoMs)分离为独立源,其中混合的噪声标签由无监督音视频一致性模型提供。利用噪声标签以及视频与音频特征间的注意力,AudioScope学习识别音视频相似性并抑制屏外声音。我们利用从开放域YFCC100m视频数据提取的短视频片段数据集证明了方法的有效性。该数据集包含在无约束条件下记录的广泛声类,使先前方法的应用并不合适。为评估与半监督实验,我们在小规模片段子集上收集了人类关于屏幕内与屏外声音存在的标签。

关键词

引用

@article{arxiv.2011.01143,
  title  = {Into the Wild with AudioScope: Unsupervised Audio-Visual Separation of On-Screen Sounds},
  author = {Efthymios Tzinis and Scott Wisdom and Aren Jansen and Shawn Hershey and Tal Remez and Daniel P. W. Ellis and John R. Hershey},
  journal= {arXiv preprint arXiv:2011.01143},
  year   = {2021}
}

备注

ICLR 2021, 27 pages