中文

深度视听学习:综述

计算机视觉与模式识别 2020-01-15 v1

摘要

视听学习旨在利用音频与视觉模态之间的关系,自深度学习开始被成功应用以来已引起相当关注。研究者倾向于利用这两种模态,要么提升先前单模态任务的性能,要么解决新的挑战性问题。在本文中,我们对近期视听学习的发展提供全面综述。我们将当前的视听学习任务划分为四个不同子领域:视听分离与定位、视听对应学习、视听生成以及视听表示学习。进一步讨论了各子领域的先进方法以及剩余挑战。最后,我们总结了常用的数据集与性能指标。

关键词

引用

@article{arxiv.2001.04758,
  title  = {Deep Audio-Visual Learning: A Survey},
  author = {Hao Zhu and Mandi Luo and Rui Wang and Aihua Zheng and Ran He},
  journal= {arXiv preprint arXiv:2001.04758},
  year   = {2020}
}