中文

用于动作识别的高效时空上下文建模

计算机视觉与模式识别 2021-04-07 v2 人工智能

摘要

上下文信息在动作识别中起着重要作用。局部操作难以建模两个具有长距离间隔的元素之间的关系。然而,直接建模任意两点间的上下文信息会在计算和内存上带来巨大开销,尤其是对于有时序维度的动作识别。受分割任务中使用的 2D 纵横交叉注意力启发,我们提出一种循环 3D 纵横交叉注意力(RCCA-3D)模块,为动作识别建模视频中密集的长程时空上下文信息。全局上下文被分解为稀疏关系图。我们在每个时刻建模同一直线上沿水平、垂直和深度方向的点之间的关系,形成 3D 纵横交叉结构,并以循环机制复用同一操作,将直线上的点间关系传递至平面,最终至整个时空空间。与非局部方法相比,所提出的 RCCA-3D 模块在视频上下文建模中将参数量和 FLOPs 分别减少 25% 和 30%。我们在三个数据集上用两个最新动作识别网络评估了 RCCA-3D 的性能,并对架构进行了透彻分析,得到了分解与融合关系图的最优方式。与其他 SOTA 方法的比较证明了我们模型的有效性与高效性。

关键词

引用

@article{arxiv.2103.11190,
  title  = {Efficient Spatialtemporal Context Modeling for Action Recognition},
  author = {Congqi Cao and Yue Lu and Yifan Zhang and Dongmei Jiang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2103.11190},
  year   = {2021}
}

备注

16 pages, 7 figures