深度学习视频字幕生成综述
计算机视觉与模式识别
2023-04-25 v1
摘要
视频字幕生成(VC)是一个快速发展的跨学科学术领域,连接了计算机视觉、自然语言处理(NLP)、语言学与人机交互等领域的工作。本质上,VC涉及理解视频并用语言描述它。字幕生成用于众多应用,从创建更易用的界面(如低视力导航)到视频问答(V-QA)、视频检索与内容生成。本综述涵盖基于深度学习的VC,包括但不限于基于注意力的架构、图网络、强化学习、对抗网络、密集视频字幕生成(DVC)等。我们讨论了该领域使用的数据集与评估指标,以及VC的局限、应用、挑战与未来方向。
引用
@article{arxiv.2304.11431,
title = {A Review of Deep Learning for Video Captioning},
author = {Moloud Abdar and Meenakshi Kollati and Swaraja Kuraparthi and Farhad Pourpanah and Daniel McDuff and Mohammad Ghavamzadeh and Shuicheng Yan and Abduallah Mohamed and Abbas Khosravi and Erik Cambria and Fatih Porikli},
journal= {arXiv preprint arXiv:2304.11431},
year = {2023}
}
备注
42 pages, 10 figures