关于 Transformers 中注意力值的分布、稀疏性及推理时量化
计算与语言
2021-06-03 v1
摘要
NLP 任务在应用阶段(推理)究竟需要 transformer 注意力机制的多少信息?从近期工作可知,transformers 中存在稀疏性,且其计算中的浮点数可被离散为更少的值而对任务精度损失极小。但这需要重训练甚至构建全新模型,二者均可能代价高昂且排放碳。聚焦于无需训练的优化,我们系统研究了所需的典型注意力值的完整范围。这指导了一种推理时量化技术的设计,其结合剪枝与对数缩放映射,仅产生少数(如 )唯一值。在问答与情感分析任务上,我们发现近 80% 的注意力值可被剪枝为零,而精度相对损失极小(<)。我们将此剪枝技术与仅将注意力值量化为 3-bit 格式结合,无需重训练,在微调 RoBERTa 的问答上仅导致 0.8% 的精度下降。
引用
@article{arxiv.2106.01335,
title = {On the Distribution, Sparsity, and Inference-time Quantization of Attention Values in Transformers},
author = {Tianchu Ji and Shraddhan Jain and Michael Ferdman and Peter Milder and H. Andrew Schwartz and Niranjan Balasubramanian},
journal= {arXiv preprint arXiv:2106.01335},
year = {2021}
}