中文

视频即图:用于视频动作识别的结构化图模块

计算机视觉与模式识别 2022-02-01 v3 图像与视频处理

摘要

在动作识别领域,视频片段总是被当作有序帧进行后续处理。为实现时空感知,现有方法提出在卷积层中嵌入相邻时间交互,从而可通过分层堆叠多个局部层获得全局语义信息。然而,这种全局时间累积只能反映深层中的高级语义,忽略了浅层中潜在的低级整体线索。本文中,我们首次提出将视频序列转化为图,以获取时间帧间的直接长程依赖。为在转化中保留序列信息,我们设计了结构化图模块(SGM),实现贯穿整个网络的细粒度时间交互。特别地,SGM 将每个节点的邻居划分为若干时间区域,从而以多样的顺序流提取全局结构信息。我们在标准基准数据集(即 Something-Something V1 & V2、Diving48、Kinetics-400、UCF101 和 HMDB51)上进行了充分实验。所报告的性能与分析表明,SGM 能以更低的计算复杂度取得优异的精度。

关键词

引用

@article{arxiv.2110.05904,
  title  = {Video Is Graph: Structured Graph Module for Video Action Recognition},
  author = {Rongchang Li and Xiao-Jun Wu and Tianyang Xu},
  journal= {arXiv preprint arXiv:2110.05904},
  year   = {2022}
}

备注

9 pages