发声物体视觉定位与声音分离的循环协同学习
计算机视觉与模式识别
2021-04-06 v1 多媒体
声音
音频与语音处理
摘要
日常生活中存在丰富的同步音频与视觉事件。在这些事件内部,音频场景与相应的视觉对象相关联;同时,发声物体能够指示并有助于分离音频轨中各自的声源。基于这一观察,本文提出一种循环协同学习(CCoL)范式,可在统一框架中联合学习发声物体视觉定位与视听声音分离。具体而言,我们可以利用已定位的对象-声音关系来改善声音分离的结果。同时,得益于分离声音所提供的判别性信息,我们改进了发声物体定位的训练样本采样,从而为两项任务构建了协同学习循环并使其互利互惠。大量实验表明,所提框架在两项任务上均优于近期对比方法,且通过我们的循环协同学习可彼此受益。
引用
@article{arxiv.2104.02026,
title = {Cyclic Co-Learning of Sounding Object Visual Grounding and Sound Separation},
author = {Yapeng Tian and Di Hu and Chenliang Xu},
journal= {arXiv preprint arXiv:2104.02026},
year = {2021}
}
备注
CVPR 2021