面向增强视觉 Transformer 的上下文感知 Token 选择与打包
计算机视觉与模式识别
2024-11-05 v2
摘要
近年来,视觉 Transformer 的长程注意力机制推动了各种计算机视觉任务的显著性能突破。然而,处理信息性 token 和非信息性 token 的传统自注意力机制存在效率和准确性不足的问题。虽然稀疏注意力机制已被引入以通过剪枝参与注意力的 token 来缓解这些问题,但它们通常缺乏上下文感知和智能性。这些机制经常在批训练中对不同输入统一应用 token 选择策略,或仅优化推理阶段的效率。为了克服这些挑战,我们提出了一种新算法:选择与打包注意力(SPA)。SPA 通过一个低成本的门控层以选择标签为监督动态选择信息性 token,并将这些 token 打包成新批次,使得可变数量的 token 可以在并行 GPU 批量训练和推理中使用。在不同数据集和计算机视觉任务上的广泛实验表明,SPA 提供了优越的性能和效率,包括目标检测中 0.6 mAP 的提升以及 16.4% 的计算成本降低。
引用
@article{arxiv.2410.23608,
title = {Context-Aware Token Selection and Packing for Enhanced Vision Transformer},
author = {Tianyi Zhang and Baoxin Li and Jae-sun Seo and Yu Cao},
journal= {arXiv preprint arXiv:2410.23608},
year = {2024}
}