中文

视频描述:方法、数据集与评估指标综述

计算机视觉与模式识别 2020-03-04 v4

摘要

视频描述是指自动生成自然语言句子以描述给定视频的内容。它在人机交互、辅助视障人士以及视频字幕等场景中有应用。由于深度学习在计算机视觉与自然语言处理领域取得了前所未有的成功,过去几年该方向研究激增。文献中已提出众多方法、数据集与评估指标,亟需一份全面综述以聚焦这一蓬勃发展的新方向的研究努力。本文通过综述以深度学习模型为重点的最先进方法来填补空白;从领域、类别数量和仓库规模方面比较基准数据集;并识别 SPICE、CIDEr、ROUGE、BLEU、METEOR 和 WMD 等各种评估指标的优缺点。经典视频描述方法将主语、宾语和动词检测与基于模板的语言模型相结合以生成句子。然而,大型数据集的发布表明这些方法无法应对无约束开放域视频中的多样性。经典方法之后是非常短暂的统计方法时代,其很快被深度学习取代,后者即当前视频描述的最先进技术。我们的综述表明,尽管发展迅猛,视频描述研究仍处于起步阶段,原因如下:视频描述模型的分析具有挑战性,因为难以确定视觉特征与所采用语言模型对最终描述中准确性或错误的贡献。现有数据集既不包含充分的视觉多样性,也不包含语言结构的复杂性。最后,当前的评估指标……

关键词

引用

@article{arxiv.1806.00186,
  title  = {Video Description: A Survey of Methods, Datasets and Evaluation Metrics},
  author = {Nayyer Aafaq and Ajmal Mian and Wei Liu and Syed Zulqarnain Gilani and Mubarak Shah},
  journal= {arXiv preprint arXiv:1806.00186},
  year   = {2020}
}

备注

Accepted by ACM Computing Surveys