中文

FIBER: 以填空作为具有挑战性的视频理解评测框架

计算机视觉与模式识别 2022-03-24 v3

摘要

我们提出以填空作为视频理解评测框架,并引入FIBER——一个包含28000个视频及描述、用于支持该评测框架的新数据集。填空设定通过要求模型在给定视频及周围文本的情况下预测视频字幕中被掩码的名词短语,来测试模型对视频的理解。FIBER基准不具备当前最先进的语言信息视频理解任务的弱点,即:(1)使用多选题的视频问答,模型因利用任务设计中的语言偏见而表现相对较好,这使得我们的框架对当前最先进系统而言具有挑战性;(2)视频字幕生成,其依赖开放式评测框架,常因系统答案若与真值在形式上不同便被视为错误而不准确。FIBER数据集及我们的代码可在 https://lit.eecs.umich.edu/fiber/ 获取。

关键词

引用

@article{arxiv.2104.04182,
  title  = {FIBER: Fill-in-the-Blanks as a Challenging Video Understanding Evaluation Framework},
  author = {Santiago Castro and Ruoyao Wang and Pingxuan Huang and Ian Stewart and Oana Ignat and Nan Liu and Jonathan C. Stroud and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2104.04182},
  year   = {2022}
}

备注

Accepted at ACL 2022 Main conference. Camera-ready version