中文

基于图学习的时空交互用于视频动作检测

计算机视觉与模式识别 2021-03-02 v3

摘要

动作检测是一项复杂任务,旨在检测并分类视频片段中的人体动作。通常,该任务通过对视频分类骨干网络提取的细粒度特征进行处理来解决。近来,得益于物体与人体检测器的鲁棒性,对关系建模的更深入关注被加入。遵循这一思路,我们提出了一种基于图的框架,用于在空间与时间上学习人与物体之间的高层交互。在我们的表述中,时空关系通过多层图结构上的自注意力来学习,该结构可连接连续片段中的实体,从而考虑长程空间与时间依赖。所提出的模块在设计上独立于骨干网络,且不需要端到端训练。我们在 AVA 数据集上进行了大量实验,我们的模型展示了最先进(SOTA)的结果以及相对于使用不同骨干网络构建的基线的一致提升。代码公开于 https://github.com/aimagelab/STAGE_action_detection。

关键词

引用

@article{arxiv.1912.04316,
  title  = {Video action detection by learning graph-based spatio-temporal interactions},
  author = {Matteo Tomei and Lorenzo Baraldi and Simone Calderara and Simone Bronzin and Rita Cucchiara},
  journal= {arXiv preprint arXiv:1912.04316},
  year   = {2021}
}

备注

This is the authors version of an article accepted for publication in Computer Vision and Image Understanding (CVIU), available online February 2021