中文

角色至关重要:具有角色感知关系的视频故事理解

计算机视觉与模式识别 2020-05-19 v1 图像与视频处理

摘要

与短视频和GIF不同,视频故事包含清晰的情节和主角列表。若不能识别出场人物与角色名称之间的联系,模型便无法真正理解情节。视频故事问答(VSQA)提供了一种有效途径来评测模型更高层次的理解能力。然而,当前VSQA方法仅从场景中提取通用视觉特征。采用此类方法,它们仍易只学到表面相关性。为真正理解谁对谁做了什么,我们提出一种持续精炼角色感知关系的新模型。该模型特别考虑视频故事中的角色,以及连接不同角色与物体的关系。基于这些信号,我们的框架通过多实例共现匹配实现弱监督人脸命名,并利用Transformer结构支持高层推理。我们在TVQA数据集中6部多样化的电视剧上训练和测试模型,该数据集是目前最大且唯一公开可用的VSQA数据集。我们通过大量消融实验在TVQA数据集上验证了所提方法。

关键词

引用

@article{arxiv.2005.08646,
  title  = {Character Matters: Video Story Understanding with Character-Aware Relations},
  author = {Shijie Geng and Ji Zhang and Zuohui Fu and Peng Gao and Hang Zhang and Gerard de Melo},
  journal= {arXiv preprint arXiv:2005.08646},
  year   = {2020}
}