中文

发声物体视觉定位与声音分离的循环协同学习

计算机视觉与模式识别 2021-04-06 v1 多媒体 声音 音频与语音处理

摘要

日常生活中存在丰富的同步音频与视觉事件。在这些事件内部,音频场景与相应的视觉对象相关联;同时,发声物体能够指示并有助于分离音频轨中各自的声源。基于这一观察,本文提出一种循环协同学习(CCoL)范式,可在统一框架中联合学习发声物体视觉定位与视听声音分离。具体而言,我们可以利用已定位的对象-声音关系来改善声音分离的结果。同时,得益于分离声音所提供的判别性信息,我们改进了发声物体定位的训练样本采样,从而为两项任务构建了协同学习循环并使其互利互惠。大量实验表明,所提框架在两项任务上均优于近期对比方法,且通过我们的循环协同学习可彼此受益。

关键词

引用

@article{arxiv.2104.02026,
  title  = {Cyclic Co-Learning of Sounding Object Visual Grounding and Sound Separation},
  author = {Yapeng Tian and Di Hu and Chenliang Xu},
  journal= {arXiv preprint arXiv:2104.02026},
  year   = {2021}
}

备注

CVPR 2021