ReduceFormer:通过求和的张量还原实现注意力机制
计算机视觉与模式识别
2024-06-12 v1
摘要
Transformer 在众多任务中表现优异,包括计算机视觉领域。然而,在低延迟或高吞吐量的应用场景中部署 Transformer 模型,受限于注意力机制中涉及矩阵乘法和 Softmax 等高计算成本操作的限制。为此,我们提出 ReduceFormer,一套为效率优化而设计的模型家族。ReduceFormer 仅利用求和和逐元素乘法等简单操作,实现了架构的大幅简化和推理性能的提升,延迟降低最高可达 37%,吞吐量提升最高可达 44%,同时保持与其他最新方法相当的准确率。该模型家族适用于计算资源和内存带宽受限的边缘设备,也适用于追求高吞吐量的云计算环境。
关键词
引用
@article{arxiv.2406.07488,
title = {ReduceFormer: Attention with Tensor Reduction by Summation},
author = {John Yang and Le An and Su Inn Park},
journal= {arXiv preprint arXiv:2406.07488},
year = {2024}
}