中文

用于视频分类与描述的深度学习

计算机视觉与模式识别 2018-02-23 v2 多媒体

摘要

在互联网带宽和存储空间的巨大增长加速下,视频数据呈爆炸式生成、发布和传播,成为当今大数据不可或缺的一部分。在本文中,我们重点回顾旨在利用深度学习促进视频理解的两条研究主线:视频分类和视频描述。视频分类侧重于根据人类动作或复杂事件等语义内容自动为视频片段打标,而视频描述则试图生成完整且自然的句子,丰富视频分类中的单一标签,以捕捉视频中最具信息量的动态。此外,我们还回顾了流行的基准测试和竞赛,这对于评估这一活跃领域的技术进步至关重要。

关键词

引用

@article{arxiv.1609.06782,
  title  = {Deep Learning for Video Classification and Captioning},
  author = {Zuxuan Wu and Ting Yao and Yanwei Fu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:1609.06782},
  year   = {2018}
}

备注

Book chapter in Frontiers of Multimedia Research