中文

用于动作检测的时空上下文

计算机视觉与模式识别 2021-06-30 v1

摘要

近年来,动作检测研究不断发展,因其在视频理解中起着关键作用。对演员与其上下文之间(空间或时间)交互进行建模已被证明对该任务至关重要。尽管近期工作使用带有聚合时间信息的空间特征,本文提出使用非聚合的时间信息。这是通过添加一种基于注意力的方法实现的,该方法利用整个视频片段中场景元素之间的时空交互。本工作的主要贡献是引入两个交叉注意力模块,以有效建模空间关系并捕获短程时间交互。在 AVA 数据集上的实验显示了所提方法的优势,该方法对场景中相关元素之间的时空关系进行建模,以 +0.31 mAP 优于其他对演员与其上下文交互进行建模的方法。

关键词

引用

@article{arxiv.2106.15171,
  title  = {Spatio-Temporal Context for Action Detection},
  author = {Manuel Sarmiento Calderó and David Varas and Elisenda Bou-Balust},
  journal= {arXiv preprint arXiv:2106.15171},
  year   = {2021}
}

备注

Computer Vision and Pattern Recognition Workshop