CARE Transformer:基于解耦双向交互的移动友好线性视觉 Transformer
计算机视觉与模式识别
2026-01-27 v2
摘要
最近,大量工作旨在设计具有线性复杂度的视觉 Transformer。然而,当前的线性注意力模型通常不适用于资源受限的移动设备,due to suffering from either few efficiency gains or significant accuracy drops。本文提出了一种新的 de\textbf{C}oupled du\textbf{A}l-interactive linea\textbf{R} att\textbf{E}ntion(CARE)机制,揭示了特征解耦和交互如何充分发挥线性注意力的潜力。我们首先提出一种非对称特征解耦策略,对局部归纳偏置和长程依赖的学习过程进行非对称解耦,从而在保持足够的局部和全局信息的同时,有效增强模型的效率。然后,采用动态记忆单元维持网络管道中的关键信息。此外,我们设计了双向交互模块有效地促进局部归纳偏置与长程信息之间的交互以及不同层之间特征的交互。通过采用解耦式学习方式并充分利用特征之间的互补性,我们的方法能够实现高效和高准确率。在 ImageNet-1K、COCO 和 ADE20K 数据集上的大量实验表明了我们方法的有效性,例如,在 ImageNet-1K 上实现 的 top-1 accuracy,仅需 GMACs。代码将在 \href{https://github.com/zhouyuan888888/CARE-Transformer}{https://github.com/zhouyuan888888/CARE-Transformer} 上发布。
关键词
引用
@article{arxiv.2411.16170,
title = {CARE Transformer: Mobile-Friendly Linear Visual Transformer via Decoupled Dual Interaction},
author = {Yuan Zhou and Qingshan Xu and Jiequan Cui and Junbao Zhou and Jing Zhang and Richang Hong and Hanwang Zhang},
journal= {arXiv preprint arXiv:2411.16170},
year = {2026}
}
备注
https://github.com/zhouyuan888888/CARE-Transformer