使用级联对手滤波网络进行视觉引导声源分离
计算机视觉与模式识别
2020-07-15 v2
摘要
本文的目标是借助声源的视觉线索从混合音频中恢复原始分量信号。此类任务通常被称为视觉引导声源分离。所提出的级联对手滤波(COF)框架由多个阶段组成,递归地精炼源分离。COF 的一个关键要素是一种新颖的对手滤波模块,可识别并重新定位源间的残差分量。系统由源的外观与运动引导,为此我们研究了基于视频帧、光流、动态图像及其组合的不同表示。最后,我们提出了一种声源位置掩码(SSLM)技术,其与 COF 共同生成源位置的像素级掩码。整个系统使用大量无标签视频端到端训练。我们将 COF 与近期基线比较,在三个具挑战性数据集(MUSIC、A-MUSIC 和 A-NATURAL)上取得了最先进(SOTA)性能。项目页面:https://ly-zhu.github.io/cof-net。
引用
@article{arxiv.2006.03028,
title = {Visually Guided Sound Source Separation using Cascaded Opponent Filter Network},
author = {Lingyu Zhu and Esa Rahtu},
journal= {arXiv preprint arXiv:2006.03028},
year = {2020}
}
备注
main paper 14 pages, ref 3 pages, and supp 7 pages. Revised argument in section 3 and 4