中文

LeMeViT:面向遥感图像解释的高效可学习元标记 Vision Transformer

计算机视觉与模式识别 2024-05-17 v1

摘要

由于遥感图像中的空间冗余,稀疏令牌通常包含丰富信息,常用于自注意力(SA)中以减少整体令牌数量,避免 Vision Transformer 中的高计算成本问题。然而,这类方法通常通过手工或难以并行化的设计获取稀疏令牌,难以在效率与性能之间取得更好平衡。与此不同,本文提出使用可学习元标记(meta tokens)来构建稀疏令牌,既有效学习关键信息,又提升推理速度。技术上,元标记首先通过跨注意力从图像令牌初始化。随后,我们提出双向跨注意力(DCA)以促进图像令牌与元标记之间的信息交换,其中它们在双分支结构中轮流作为查询和键(值)令牌使用,显著降低计算复杂度。通过在稠密视觉令牌中早期阶段采用 DCA,我们获得了各种规模的层次架构 LeMeViT。在分类和密集预测任务中的实验结果表明,LeMeViT 相较于基线模型实现了显著的 1.7×1.7 \times 加速、更少参数和具竞争性能,更好地实现了效率与性能之间的平衡。

关键词

引用

@article{arxiv.2405.09789,
  title  = {LeMeViT: Efficient Vision Transformer with Learnable Meta Tokens for Remote Sensing Image Interpretation},
  author = {Wentao Jiang and Jing Zhang and Di Wang and Qiming Zhang and Zengmao Wang and Bo Du},
  journal= {arXiv preprint arXiv:2405.09789},
  year   = {2024}
}

备注

Accepted by IJCAI'2024. The code is available at https://github.com/ViTAE-Transformer/LeMeViT