中文

基于时空定位的视频情境识别

计算机视觉与模式识别 2022-10-21 v1

摘要

密集视频理解需要回答若干问题,例如谁对谁做了什么、用什么、如何、为何以及何处。近来,视频情境识别(VidSitu)被构建为一项结构化预测任务,用于预测多个事件、它们的关系、动作以及附着于描述性实体的各种动词-角色对。该任务在跨多个动词-角色对识别、消歧和共指实体方面存在若干挑战,同时也面临一些评估上的挑战。在本工作中,我们提出在弱监督设定下将时空定位作为结构化预测任务的基本组成部分,并提出了一种新颖的三阶段 Transformer 模型 VideoWhisperer,其能够进行联合预测。在第一阶段,我们并行学习视频特征的上下文嵌入与视频片段中出现的关键对象,以实现细粒度时空推理。第二阶段中,动词-角色查询关注并从对象嵌入中池化信息,定位针对动作所提问题的答案。最后阶段将这些答案生成为描述视频中每个动词-角色对的字幕。我们的模型同时处理一组事件(片段),并即时预测动词、动词-角色对、其名词及其定位。在 VidSitu 数据集的定位增强版本上评估时,我们观察到实体字幕准确性的大幅提升,以及无需训练时定位标注即可定位动词-角色的能力。

关键词

引用

@article{arxiv.2210.10828,
  title  = {Grounded Video Situation Recognition},
  author = {Zeeshan Khan and C. V. Jawahar and Makarand Tapaswi},
  journal= {arXiv preprint arXiv:2210.10828},
  year   = {2022}
}

备注

Accepted to NeurIPS 2022. Project Page: https://zeeshank95.github.io/grvidsitu