中文

课程视听学习

计算机视觉与模式识别 2020-01-28 v1

摘要

在复杂视听场景中关联声音与其产生者是一项具有挑战性的任务,尤其是在缺乏标注训练数据时。在本文中,我们提出了一种灵活的视听模型,其引入一个软聚类模块作为音频和视觉内容检测器,并将视听并发的普遍属性视为推断所检测内容间相关性的潜在监督。为降低视听学习的难度,我们提出了一种新颖的课程学习策略,使模型从简单到复杂场景进行训练。我们展示了这种有序学习过程赋予模型易于训练和快速收敛的优点。同时,我们的视听模型还能提供有效的单模态表示和跨模态对齐性能。我们进一步将训练良好的模型部署到实际的视听声音定位与分离任务中。我们展示了我们的定位模型显著优于现有方法,基于此我们在无需外部视觉监督的情况下展示了可比的声音分离性能。我们的视频演示可在 https://youtu.be/kuClfGG0cFU 找到。

关键词

引用

@article{arxiv.2001.09414,
  title  = {Curriculum Audiovisual Learning},
  author = {Di Hu and Zheng Wang and Haoyi Xiong and Dong Wang and Feiping Nie and Dejing Dou},
  journal= {arXiv preprint arXiv:2001.09414},
  year   = {2020}
}