中文

面向密集预测的内存高效 Transformer 适配器

计算机视觉与模式识别 2025-02-05 v1

摘要

尽管当前的视觉 Transformer (ViT) 适配器方法已展现出可观的精度,但其推理速度隐式地受到低效内存访问操作(例如标准归一化和频繁的形状重塑)的阻碍。在这项工作中,我们提出了 META,一种简单且快速的 ViT 适配器,它通过减少低效的内存访问操作来提高模型的内存效率并减少内存时间消耗。我们的方法采用了一个内存高效的适配器模块,该模块支持在自注意力和前馈网络层之间共享层归一化,从而减少模型对归一化操作的依赖。在所提出的模块中,采用了十字形自注意力以减少模型频繁的形状重塑操作。此外,我们用一个轻量级卷积分支增强了适配器模块,该分支可以增强局部归纳偏置,尤其有利于密集预测任务,例如目标检测、实例分割和语义分割。该适配器模块最终以级联方式构建,以计算多样化的头部特征,从而丰富特征表示的多样性。在多个代表性数据集上的广泛评估验证了 META 显著提升了预测质量,同时实现了新的最先进的精度-效率权衡。理论上,我们证明了 META 展现出优越的泛化能力和更强的适应性。

关键词

引用

@article{arxiv.2502.01962,
  title  = {Memory Efficient Transformer Adapter for Dense Predictions},
  author = {Dong Zhang and Rui Yan and Pingcheng Dong and Kwang-Ting Cheng},
  journal= {arXiv preprint arXiv:2502.01962},
  year   = {2025}
}

备注

This paper is accepted by ICLR 2025