中文

密集视频描述:技术、数据集与评估协议综述

计算机视觉与模式识别 2023-11-07 v1 人工智能

摘要

未裁剪视频包含相互关联的事件、依赖关系、上下文、重叠事件、物体-物体交互、领域特异性以及其他在通过自然语言描述视频时值得突出的语义。由于这种巨大的多样性,单个句子只能正确描述视频的一部分。密集视频描述(DVC)旨在检测并描述给定视频中的不同事件。DVC一词起源于2017年ActivityNet挑战赛,此后人们做出了大量努力来应对该挑战。密集视频描述分为三个子任务:(1) 视频特征提取(VFE),(2) 时间事件定位(TEL),以及 (3) 密集描述生成(DCG)。本综述旨在讨论所有声称执行DVC及其子任务的研究并总结其结果。我们还讨论了所有用于DVC的数据集。最后,我们强调了该领域一些新兴挑战与未来趋势。

关键词

引用

@article{arxiv.2311.02538,
  title  = {Dense Video Captioning: A Survey of Techniques, Datasets and Evaluation Protocols},
  author = {Iqra Qasim and Alexander Horsch and Dilip K. Prasad},
  journal= {arXiv preprint arXiv:2311.02538},
  year   = {2023}
}

备注

35 pages, 10 figures