深度视听学习:综述
计算机视觉与模式识别
2020-01-15 v1
摘要
视听学习旨在利用音频与视觉模态之间的关系,自深度学习开始被成功应用以来已引起相当关注。研究者倾向于利用这两种模态,要么提升先前单模态任务的性能,要么解决新的挑战性问题。在本文中,我们对近期视听学习的发展提供全面综述。我们将当前的视听学习任务划分为四个不同子领域:视听分离与定位、视听对应学习、视听生成以及视听表示学习。进一步讨论了各子领域的先进方法以及剩余挑战。最后,我们总结了常用的数据集与性能指标。
引用
@article{arxiv.2001.04758,
title = {Deep Audio-Visual Learning: A Survey},
author = {Hao Zhu and Mandi Luo and Rui Wang and Aihua Zheng and Ran He},
journal= {arXiv preprint arXiv:2001.04758},
year = {2020}
}