中文

VIOLIN:用于视频与语言推理的大规模数据集

计算机视觉与模式识别 2020-03-27 v1 人工智能 计算与语言

摘要

我们引入一项新任务——视频与语言推理(Video-and-Language Inference),用于视频与文本的联合多模态理解。给定带有对齐字幕的短视频片段作为前提,配以基于视频内容的自然语言假设,模型需要推断该假设是被给定视频片段蕴含还是矛盾。为此任务引入了一个名为 Violin(VIdeO-and-Language INference)的新大规模数据集,包含来自 15,887 个视频片段的 95,322 个视频-假设对,视频总时长超过 582 小时。这些视频片段内容丰富的时序动态、事件转换与人物交互,采集自两个来源:(i)热门电视节目,以及(ii)YouTube 频道的电影片段。为应对这一新多模态推理任务,模型需具备精细推理能力,从表层定位(如识别视频中的物体与角色)到深层常识推理(如推断视频中事件的因果关系)。我们给出了数据集的详细分析,并对众多强基线模型进行了广泛评估,为该新任务的挑战提供了有价值的见解。

关键词

引用

@article{arxiv.2003.11618,
  title  = {VIOLIN: A Large-Scale Dataset for Video-and-Language Inference},
  author = {Jingzhou Liu and Wenhu Chen and Yu Cheng and Zhe Gan and Licheng Yu and Yiming Yang and Jingjing Liu},
  journal= {arXiv preprint arXiv:2003.11618},
  year   = {2020}
}

备注

Accepted to CVPR2020