中文

VideoMCC:一个用于视频理解的新基准

计算机视觉与模式识别 2017-06-20 v5

摘要

尽管人们普遍认同未来用于组织、浏览和搜索视频的技术取决于开发对视频进行高层语义理解的方法,但迄今为止,对于训练和评估此类任务模型的最佳方式尚未达成共识。将视频理解表述为一种动作或事件分类形式存在问题,因为尚不完全清楚该领域中的语义类别或抽象应该是什么。语言已被用来回避定义视频类别的问题,通过将视频理解表述为字幕或描述任务。然而,语言高度复杂、冗余且有时模糊不清。许多不同的字幕可能表达相同的语义概念。为了解释这种模糊性,视频描述的定量评估需要复杂的度量标准,其性能分数通常难以被人类解读。本文对此问题提供了四项贡献。首先,我们将视频多项选择字幕(VideoMCC)定义为一个新的、定义明确的任务,并具有易于解释的性能度量。其次,我们描述了一种通用的半自动程序来为此任务创建基准。第三,我们公开发布了一个通过实施该程序创建的大规模视频基准,并包含了一项评估人类在我们数据集上表现的研究。最后,我们提出并测试了多种方法在该基准上的表现,旨在更好地理解视频理解所带来的新挑战。

关键词

引用

@article{arxiv.1606.07373,
  title  = {VideoMCC: a New Benchmark for Video Comprehension},
  author = {Du Tran and Maksim Bolonkin and Manohar Paluri and Lorenzo Torresani},
  journal= {arXiv preprint arXiv:1606.07373},
  year   = {2017}
}