视频字幕生成:现状比较综述与可能路径
计算机视觉与模式识别
2022-04-14 v2
摘要
视频字幕生成是描述图像序列内容并捕捉其语义关系与含义的过程。用单幅图像处理该任务已属艰巨,更毋论视频(或图像序列)之困难。视频字幕生成的应用之广与重要性之大,主要体现在处理视频监控中大量的视频记录,或辅助视障人士等少数例子。为分析我们的学界在解决视频字幕生成任务上的努力方向,以及何种路径更值得遵循,本文对 2016 至 2021 年间的 105 余篇论文进行了广泛综述。结果上,识别出了最常用数据集与评价指标,以及所使用的主要方法与最优方法。我们基于若干性能度量计算了一组排序,以依性能取得视频字幕生成任务上结果最佳的方法。最后,就应对这一复杂任务可能采取的下一步或机会领域得出了若干见解。
引用
@article{arxiv.2204.05976,
title = {Video Captioning: a comparative review of where we are and which could be the route},
author = {Daniela Moctezuma and Tania Ramírez-delReal and Guillermo Ruiz and Othón González-Chávez},
journal= {arXiv preprint arXiv:2204.05976},
year = {2022}
}
备注
review, 20 pages