中文

身份感知的多句视频描述

计算机视觉与模式识别 2020-08-25 v1

摘要

标准的视频与电影描述任务抽象掉了人物身份,因而无法在句子之间建立身份关联。我们提出了一种多句身份感知视频描述任务,克服了该局限,并要求在一系列连续片段中局部地重新识别人物。我们引入了一个辅助任务“填充身份”(Fill-in the Identity),旨在给定视频描述时,在一组片段中一致地预测人物ID。我们针对该任务提出的方法利用了Transformer架构,可对多个ID进行连贯的联合预测。其中一个关键组成部分是性别感知的文本表示,以及主模型中额外的性别预测目标。该辅助任务使我们能够提出一种两阶段的身份感知视频描述方法。我们首先生成多句视频描述,然后应用我们的填充身份模型在预测出的人物实体之间建立关联。为能够处理这两个任务,我们用适合我们问题表述的新标注扩充了大规模电影描述挑战赛(LSMDC)基准。实验表明,我们提出的填充身份模型优于若干基线和近期工作,并使我们能够生成具有局部重新识别人物的描述。

关键词

引用

@article{arxiv.2008.09791,
  title  = {Identity-Aware Multi-Sentence Video Description},
  author = {Jae Sung Park and Trevor Darrell and Anna Rohrbach},
  journal= {arXiv preprint arXiv:2008.09791},
  year   = {2020}
}

备注

Project link at https://sites.google.com/site/describingmovies/lsmdc-2019/