中文

面向视频理解的视觉语义角色标注

计算机视觉与模式识别 2021-04-05 v1 计算与语言

摘要

我们提出一种利用视觉语义角色标注来理解和表示视频中相关显著事件的新框架。我们将视频表示为一组相关事件,其中每个事件由一个动词和多个充当该事件相关角色的实体组成。为研究视频中语义角色标注(即VidSRL)这一具有挑战性的任务,我们引入了VidSitu基准,这是一个大规模视频理解数据源,包含29K29K1010秒电影片段,每22秒都富含动词与语义角色的精细标注。实体在电影片段内的各事件间共指,事件之间通过事件-事件关系相互连接。VidSitu中的片段取自大量电影集合(3K{\sim}3K),并被选取为既复杂(视频内约4.24.2个不同动词)又多样(约200200个动词各有超过100100条标注)。我们与其他公开视频理解基准进行了全面的数据集对比分析,给出了若干示例性基线,并评估了一系列标准视频识别模型。我们的代码与数据集可在vidsitu.org获取。

关键词

引用

@article{arxiv.2104.00990,
  title  = {Visual Semantic Role Labeling for Video Understanding},
  author = {Arka Sadhu and Tanmay Gupta and Mark Yatskar and Ram Nevatia and Aniruddha Kembhavi},
  journal= {arXiv preprint arXiv:2104.00990},
  year   = {2021}
}

备注

CVPR21 camera-ready including appendix. Project Page at https://vidsitu.org/