TReX- 重用 Vision Transformer 的注意力以实现高效的 Xbar 计算
人工智能
2024-08-26 v1 硬件体系结构
摘要
由于 Vision Transformer (ViT) 的高计算开销, 越来越多研究旨在开发内存计算架构以实现边缘计算场景中的能源效率。已有工作提出了高效的算法硬件协同设计和 IMC 架构改进以提高 IMC 实现的 ViT 的能源效率。然而, 所有已有工作都忽略了注意力模块在 IMC 实现 ViT 的准确性、能耗、延迟和面积上的开销及其相互依赖。为此, 我们提出了 TReX- 一个基于注意力复用的 ViT 优化框架, 有效地在 ViT 模型中实现注意力复用, 以实现最佳的准确性-能耗-延迟-面积权衡。TReX 在选择注意力复用的 transformer 编码器方面进行最优选择, 以实现接近等准确性的性能, 同时满足用户指定的延迟要求。基于对 Imagenet-1k 数据集的分析, 我们发现 TReX 在 DeiT-S (LV-ViT-S) ViT 模型中实现了 2.3 倍 (2.19 倍) 的 EDAP 减少和 1.86 倍 (1.79 倍) 的 TOPS/mm2 改善, 同时仅有约 1% 的准确性下降。此外, TReX 在高 EDAP 减少情况下仍能保持高准确性, 与最先进的 token 剪枝和权重共享方法相比表现更好。在诸如 CoLA 等 NLP 任务上, TReX 在 1.6 倍更低的 EDAP 下实现了 2% 更高的非理想准确性。
引用
@article{arxiv.2408.12742,
title = {TReX- Reusing Vision Transformer's Attention for Efficient Xbar-based Computing},
author = {Abhishek Moitra and Abhiroop Bhattacharjee and Youngeun Kim and Priyadarshini Panda},
journal= {arXiv preprint arXiv:2408.12742},
year = {2024}
}
备注
12 pages