用于动作识别的视觉Transformer:综述
计算机视觉与模式识别
2022-09-14 v1 人工智能
图像与视频处理
摘要
视觉 Transformer 正成为解决计算机视觉问题的有力工具。近期技术也证明了 Transformer 在图像域之外解决众多视频相关任务的有效性。其中,人体动作识别因其广泛应用受到研究界特别关注。本文提供首个面向动作识别的视觉 Transformer 技术全面综述。我们分析并总结该方向现有与新兴文献,同时凸显适配 Transformer 于动作识别的流行趋势。因其专门应用,我们统称这些方法为“动作 Transformer”。我们的文献综述基于架构、模态与预期目标为动作 Transformer 提供合适分类法。在动作 Transformer 语境下,我们探究编码时空数据、降维、帧块与时空立方体构建及多种表示方法的技术。我们还考察 Transformer 层中时空注意力的优化以处理更长序列,通常借由减少单次注意力操作中的令牌数。此外,我们调研不同网络学习策略,如自监督与零样本学习,及其用于基于 Transformer 动作识别的相关损失。本综述亦总结在重要基准上以动作 Transformer 获取评估指标得分的进展。最后,给出该研究方向挑战、展望与未来途径的讨论。
引用
@article{arxiv.2209.05700,
title = {Vision Transformers for Action Recognition: A Survey},
author = {Anwaar Ulhaq and Naveed Akhtar and Ganna Pogrebna and Ajmal Mian},
journal= {arXiv preprint arXiv:2209.05700},
year = {2022}
}
备注
15 Figures and 5 Tables