利用类别信息实现单帧视觉声源分离
计算机视觉与模式识别
2021-04-19 v2
摘要
视觉声源分离旨在借助视觉线索从给定的声音混合中识别声音成分。先前的工作已展示出令人印象深刻的成果,但代价是庞大的多阶段架构和复杂的数据表示(例如光流轨迹)。相比之下,我们研究仅使用单视频帧的简洁而高效的视觉声音分离模型。此外,我们的模型能够在分离过程中利用声源类别的信息。为此,我们提出了两种模型,其中假设 i) 类别标签在训练时可用,或 ii) 我们已知训练样本对是否来自相同或不同类别。在 MUSIC 数据集上的实验表明,与若干近期基线方法相比,我们的模型取得了相当或更好的性能。代码见 https://github.com/ly-zhu/Leveraging-Category-Information-for-Single-Frame-Visual-Sound-Source-Separation
引用
@article{arxiv.2007.07984,
title = {Leveraging Category Information for Single-Frame Visual Sound Source Separation},
author = {Lingyu Zhu and Esa Rahtu},
journal= {arXiv preprint arXiv:2007.07984},
year = {2021}
}
备注
6 pages. The code is available at https://github.com/ly-zhu/Leveraging-Category-Information-for-Single-Frame-Visual-Sound-Source-Separation