基于减加网络的递归视觉声音分离
计算机视觉与模式识别
2019-10-24 v2 声音
音频与语音处理
摘要
声音为许多任务提供了丰富的语义信息,是对视觉数据的补充。然而在实践中,来自多个声源的声音常常混合在一起。本文提出一种称为减加网络(MinusPlus Network,MP-Net)的新框架,用于视觉声音分离任务。MP-Net 按照平均能量顺序递归地分离声音,在每次预测结束时从混合物中移除已分离的声音,直到混合物变空或仅含噪声。通过这种方式,MP-Net 可应用于具有任意数量和类型声音的声音混合物。此外,当 MP-Net 不断从混合物中移除高能量声音时,低能量声音可能会显现并变得更清晰,从而使分离更准确。与以往方法相比,MP-Net 在两种大规模数据集上针对不同类型和数量的声音混合物取得了最先进(state-of-the-art)的结果。
引用
@article{arxiv.1908.11602,
title = {Recursive Visual Sound Separation Using Minus-Plus Net},
author = {Xudong Xu and Bo Dai and Dahua Lin},
journal= {arXiv preprint arXiv:1908.11602},
year = {2019}
}
备注
accepted by ICCV2019