DualFormer:用于高效视频识别的局部-全局分层 Transformer
计算机视觉与模式识别
2022-11-23 v3 人工智能
摘要
虽然 Transformer 凭借其捕获长程依赖关系的强大能力在视频识别中展现出巨大潜力,但它们常常因对大量 3D 标记的自注意力机制而产生高昂的计算成本。本文提出了一种名为 DualFormer 的新型 Transformer 架构,能够高效地执行视频识别的时空注意力。具体而言,DualFormer 将完整的时空注意力分层为双重级联级别,即首先学习邻近 3D 标记间的细粒度局部交互,然后捕获查询标记与全局金字塔上下文之间的粗粒度全局依赖关系。与现有方法应用时空分解或将注意力计算限制在局部窗口内以提高效率不同,我们的局部-全局分层策略能够很好地捕获短程和长程时空依赖关系,同时大幅减少注意力计算中键和值的数量以提升效率。实验结果验证了 DualFormer 在五个视频基准上相对于现有方法的优越性。特别是,DualFormer 在 Kinetics-400/600 上分别达到了 82.9%/85.2% 的 top-1 准确率,推理 FLOPs 约为 1000G,比具有相似性能的现有方法至少少 3.2 倍。我们已在 https://github.com/sail-sg/dualformer 发布了源代码。
引用
@article{arxiv.2112.04674,
title = {DualFormer: Local-Global Stratified Transformer for Efficient Video Recognition},
author = {Yuxuan Liang and Pan Zhou and Roger Zimmermann and Shuicheng Yan},
journal= {arXiv preprint arXiv:2112.04674},
year = {2022}
}
备注
Accepted by ECCV 2022