中文

视频到文本问题的全面综述

计算机视觉与模式识别 2021-12-02 v3 计算与语言

摘要

视觉与语言领域的研究涵盖了旨在连接视觉与文本信息的诸多挑战性课题。当视觉信息涉及视频时,便进入视频-文本研究,其包含若干挑战性任务,如视频问答、自然语言视频摘要,以及视频到文本与文本到视频转换。本文综述视频到文本问题,其目标是将输入视频与其文本描述相关联。这种关联主要通过从语料库中检索最相关的描述,或在给定上下文视频时生成新描述来实现。这两种方式代表了计算机视觉与自然语言处理社区的基本任务,称为从视频检索文本任务和视频字幕/描述任务。这两项任务比从图像预测或检索单句要复杂得多。视频中存在的时空信息在视觉内容和关联语言描述的结构上引入了多样性与复杂性。本综述对视频到文本问题的最先进技术进行了分类与描述,涵盖主要的视频到文本方法及其性能评估方式。我们分析了二十六个基准数据集,展示了它们针对该问题需求的缺点与优势。我们还展示了研究者在各数据集上取得的进展,涵盖了该领域的挑战,并讨论了未来研究方向。

关键词

引用

@article{arxiv.2103.14785,
  title  = {A Comprehensive Review of the Video-to-Text Problem},
  author = {Jesus Perez-Martin and Benjamin Bustos and Silvio Jamil F. Guimarães and Ivan Sipiran and Jorge Pérez and Grethel Coello Said},
  journal= {arXiv preprint arXiv:2103.14785},
  year   = {2021}
}

备注

66 pages, 6 figures. Accepted by Artificial Intelligence Review