中文

GeoDeformer:用于动作识别的几何可变形Transformer

计算机视觉与模式识别 2023-12-01 v1

摘要

视觉Transformer最近已成为卷积网络用于动作识别的有效替代方案。然而,视觉Transformer仍然难以应对视频数据中普遍存在的几何变化。本文提出了一种新方法GeoDeformer,旨在通过直接将几何理解集成到ViT架构中来捕获动作视频中固有的变化。具体而言,GeoDeformer的核心是几何形变预测器,这是一个用于识别和量化给定视频中潜在空间与时间几何形变的模块。空间形变调整各帧内的几何结构,而时间形变捕获跨帧几何动态,反映运动与时间进程。为证明我们方法的有效性,我们将其集成到成熟的MViTv2框架中,用GeoDeformer块替换标准自注意力块。我们在UCF101、HMDB51和Mini-K200上的实验实现了Top-1和Top-5准确率的显著提升,以仅边际增加的计算成本建立了新的最先进结果。此外,可视化证实GeoDeformer有效显现了显式几何形变并最小化了几何变化。代码与检查点将公开发布。

关键词

引用

@article{arxiv.2311.17975,
  title  = {GeoDeformer: Geometric Deformable Transformer for Action Recognition},
  author = {Jinhui Ye and Jiaming Zhou and Hui Xiong and Junwei Liang},
  journal= {arXiv preprint arXiv:2311.17975},
  year   = {2023}
}

备注

Including geometric transformations into ViT