中文

用于动作识别的视觉Transformer:综述

计算机视觉与模式识别 2022-09-14 v1 人工智能 图像与视频处理

摘要

视觉 Transformer 正成为解决计算机视觉问题的有力工具。近期技术也证明了 Transformer 在图像域之外解决众多视频相关任务的有效性。其中,人体动作识别因其广泛应用受到研究界特别关注。本文提供首个面向动作识别的视觉 Transformer 技术全面综述。我们分析并总结该方向现有与新兴文献,同时凸显适配 Transformer 于动作识别的流行趋势。因其专门应用,我们统称这些方法为“动作 Transformer”。我们的文献综述基于架构、模态与预期目标为动作 Transformer 提供合适分类法。在动作 Transformer 语境下,我们探究编码时空数据、降维、帧块与时空立方体构建及多种表示方法的技术。我们还考察 Transformer 层中时空注意力的优化以处理更长序列,通常借由减少单次注意力操作中的令牌数。此外,我们调研不同网络学习策略,如自监督与零样本学习,及其用于基于 Transformer 动作识别的相关损失。本综述亦总结在重要基准上以动作 Transformer 获取评估指标得分的进展。最后,给出该研究方向挑战、展望与未来途径的讨论。

关键词

引用

@article{arxiv.2209.05700,
  title  = {Vision Transformers for Action Recognition: A Survey},
  author = {Anwaar Ulhaq and Naveed Akhtar and Ganna Pogrebna and Ajmal Mian},
  journal= {arXiv preprint arXiv:2209.05700},
  year   = {2022}
}

备注

15 Figures and 5 Tables