中文

用于时空动作定位的Actor-Context-Actor关系网络

计算机视觉与模式识别 2021-04-22 v3 机器学习 图像与视频处理

摘要

从视频中定位人物并识别其动作是迈向高层次视频理解的一项具有挑战性的任务。最近的进展是通过建模实体之间的直接成对关系取得的。在本文中,我们更进一步,不仅建模成对之间的直接关系,还考虑了建立在多个元素之上的间接高阶关系。我们提出显式建模Actor-Context-Actor关系,即基于两个Actor与上下文的交互而建立的它们之间的关系。为此,我们设计了一个Actor-Context-Actor关系网络(ACAR-Net),该网络构建于一种新颖的高阶关系推理算子和一个Actor-Context特征库之上,以实现时空动作定位的间接关系推理。在AVA和UCF101-24数据集上的实验显示了建模actor-context-actor关系的优势,注意力图的可视化进一步验证了我们的模型能够找到相关的高阶关系来支持动作检测。值得注意的是,我们的方法在ActivityNet Challenge 2020的AVA-Kinetics动作定位任务中排名第一,以显著优势(+6.71 mAP)超越其他参赛作品。训练代码和模型将在https://github.com/Siyu-C/ACAR-Net上提供。

关键词

引用

@article{arxiv.2006.07976,
  title  = {Actor-Context-Actor Relation Network for Spatio-Temporal Action Localization},
  author = {Junting Pan and Siyu Chen and Mike Zheng Shou and Yu Liu and Jing Shao and Hongsheng Li},
  journal= {arXiv preprint arXiv:2006.07976},
  year   = {2021}
}

备注

Accepted in CVPR 2021