中文

面向硬件感知 Transformer 适配的层级特定标量函数演化

计算机视觉与模式识别 2026-05-15 v1 硬件体系结构

摘要

Vision Transformers (ViTs) 在具有挑战性的视觉任务上取得了 SOTA 性能,但其层归一化带来的计算复杂度和全局归约瓶颈严重阻碍了其在边缘设备上的部署。近期方法试图通过用硬件友好的标量近似替代归一化层来绕过这一问题。然而,这些同质化替代并不能最优地适配所有层的行为,且依赖于昂贵的模型重训练。在本工作中,我们提出了一个高效的硬件感知框架,利用遗传编程(GP)直接从预训练权重中演化出异构的、层级特定的标量函数。结合一种新颖的训练后重对齐策略,我们的方法完全消除了从头重训练模型的需要。我们演化出的表达式能准确近似目标归一化行为,捕获了 91.6%91.6\% 的方差(R2R^2),而同质化基线仅能捕获 70.2%70.2\%,这使得我们修改后的架构仅需 20 个 epoch 即可恢复 84.25%84.25\% 的 Top-1 ImageNet-1K 准确率。在消除全局归约瓶颈的同时保持此性能,我们的方法在算术复杂度与片外存储流量之间建立了极具优势的权衡,消除了在边缘加速器上高效部署 ViTs 的主要障碍。

关键词

引用

@article{arxiv.2605.14047,
  title  = {Evolving Layer-Specific Scalar Functions for Hardware-Aware Transformer Adaptation},
  author = {Kieran Carrigg and Sigur de Vries and Amirhossein Sadough and Marcel van Gerven},
  journal= {arXiv preprint arXiv:2605.14047},
  year   = {2026}
}

备注

18 pages, 7 figures