FAR:面向IMC友好推理的保功能注意力替换
计算机视觉与模式识别
2026-05-18 v4 人工智能
机器学习
摘要
虽然Transformer在现代视觉和语言模型中占据主导地位,但其注意力机制由于密集的激活值到激活值乘法和非局部内存访问,仍然不适合存内计算(IMC)设备,导致在基于ReRAM的加速器上产生显著的延迟和带宽开销。为了解决这种不匹配,我们提出了FAR,一个保功能注意力替换框架,用本质上兼容IMC数据流的顺序模块替换预训练DeiT中的所有注意力。具体而言,FAR通过逐块蒸馏将自注意力替换为多头双向LSTM架构,以保持功能等效性,同时实现线性时间计算和局部权重重用。我们进一步在FAR模型中引入结构化剪枝,使其能够灵活适应资源受限的IMC阵列,同时保持功能保真度。在DeiT系列上的评估表明,FAR在ImageNet和多个下游任务上保持了与原始基于注意力的模型相当的准确性,且参数更少、延迟更低。进一步分析表明,FAR保留了注意力学习到的语义token关系,同时提高了计算效率,突显了其在基于IMC的边缘加速器上进行能效Transformer推理的潜力。
引用
@article{arxiv.2505.21535,
title = {FAR: Function-preserving Attention Replacement for IMC-friendly Inference},
author = {Yuxin Ren and Maxwell D Collins and Miao Hu and Huanrui Yang},
journal= {arXiv preprint arXiv:2505.21535},
year = {2026}
}
备注
7 pages main paper, 6 figures; accepted by GLSVLSI 2026