中文

利用类别信息实现单帧视觉声源分离

计算机视觉与模式识别 2021-04-19 v2

摘要

视觉声源分离旨在借助视觉线索从给定的声音混合中识别声音成分。先前的工作已展示出令人印象深刻的成果,但代价是庞大的多阶段架构和复杂的数据表示(例如光流轨迹)。相比之下,我们研究仅使用单视频帧的简洁而高效的视觉声音分离模型。此外,我们的模型能够在分离过程中利用声源类别的信息。为此,我们提出了两种模型,其中假设 i) 类别标签在训练时可用,或 ii) 我们已知训练样本对是否来自相同或不同类别。在 MUSIC 数据集上的实验表明,与若干近期基线方法相比,我们的模型取得了相当或更好的性能。代码见 https://github.com/ly-zhu/Leveraging-Category-Information-for-Single-Frame-Visual-Sound-Source-Separation

关键词

引用

@article{arxiv.2007.07984,
  title  = {Leveraging Category Information for Single-Frame Visual Sound Source Separation},
  author = {Lingyu Zhu and Esa Rahtu},
  journal= {arXiv preprint arXiv:2007.07984},
  year   = {2021}
}

备注

6 pages. The code is available at https://github.com/ly-zhu/Leveraging-Category-Information-for-Single-Frame-Visual-Sound-Source-Separation