汉明注意力蒸馏:二值化键和查询以实现高效长上下文Transformer
机器学习
2025-02-05 v1 人工智能
图像与视频处理
摘要
具有扩展上下文窗口的预训练Transformer模型在大规模运行时计算和内存需求极高,这通常限制了其实际部署。在本文中,我们引入了汉明注意力蒸馏(HAD),这是一种新颖的框架,它通过二值化注意力机制中的键和查询来实现显著的效率提升。通过将键和查询转换为{-1, +1}向量,并用高效的汉明距离计算替代点积操作,我们的方法大幅减少了计算开销。此外,我们结合了注意力矩阵稀疏化以剪枝低影响激活,这进一步降低了处理长上下文序列的成本。尽管采用了这些激进的压缩策略,我们的蒸馏方法仍保持了高度的表征能力,与先前的Transformer二值化方法相比,准确率得到了显著提高。我们在包括GLUE基准、ImageNet和QuALITY在内的一系列任务和模型上评估了HAD,展示了在二值化Transformer中达到最先进性能的同时,大幅降低了长上下文推理的计算成本。我们在定制硬件模拟中实现了HAD,与标准注意力的定制硬件实现相比,展示了优越的性能特征。HAD在GLUE上仅损失了**1.78%**的性能,而最先进的二值化工作损失了9.08%;在ImageNet上损失了**2.5%**的性能,而后者损失了12.14%,同时其目标定制硬件与标准注意力对应物相比,面积减少了**79%**,功耗降低了**87%**。
引用
@article{arxiv.2502.01770,
title = {Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers},
author = {Mark Horton and Tergel Molom-Ochir and Peter Liu and Bhavna Gopal and Chiyue Wei and Cong Guo and Brady Taylor and Deliang Fan and Shan X. Wang and Hai Li and Yiran Chen},
journal= {arXiv preprint arXiv:2502.01770},
year = {2025}
}