基于自监督音视频匹配的可判别发声物体定位
计算机视觉与模式识别
2020-10-13 v1 机器学习
多媒体
声音
音频与语音处理
摘要
在鸡尾酒会式(即混合声音场景)中判别性地定位发声物体,对人类而言司空见惯,但对机器来说仍具挑战性。本文提出一种两阶段学习框架,用于执行自监督的类别感知发声物体定位。首先,我们提出通过聚合单声源场景中的候选声音定位结果来学习鲁棒的物体表示。然后,通过参考预学习的物体知识,在鸡尾酒会场景中生成类别感知的物体定位图,并通过匹配音频与视觉物体类别分布来相应选取发声物体,其中音视频一致性被视为自监督信号。在真实与合成的鸡尾酒会视频上的实验结果表明,我们的模型在滤除静音物体和指出不同类别发声物体位置方面具有优越性。代码见 https://github.com/DTaoo/Discriminative-Sounding-Objects-Localization。
引用
@article{arxiv.2010.05466,
title = {Discriminative Sounding Objects Localization via Self-supervised Audiovisual Matching},
author = {Di Hu and Rui Qian and Minyue Jiang and Xiao Tan and Shilei Wen and Errui Ding and Weiyao Lin and Dejing Dou},
journal= {arXiv preprint arXiv:2010.05466},
year = {2020}
}
备注
To appear in NeurIPS 2020. Previous Title: Learning to Discriminatively Localize Sounding Objects in a Cocktail-party Scenario