中文

关于 Transformers 中注意力值的分布、稀疏性及推理时量化

计算与语言 2021-06-03 v1

摘要

NLP 任务在应用阶段(推理)究竟需要 transformer 注意力机制的多少信息?从近期工作可知,transformers 中存在稀疏性,且其计算中的浮点数可被离散为更少的值而对任务精度损失极小。但这需要重训练甚至构建全新模型,二者均可能代价高昂且排放碳。聚焦于无需训练的优化,我们系统研究了所需的典型注意力值的完整范围。这指导了一种推理时量化技术的设计,其结合剪枝与对数缩放映射,仅产生少数(如 232^3)唯一值。在问答与情感分析任务上,我们发现近 80% 的注意力值可被剪枝为零,而精度相对损失极小(<1.0%1.0\%)。我们将此剪枝技术与仅将注意力值量化为 3-bit 格式结合,无需重训练,在微调 RoBERTa 的问答上仅导致 0.8% 的精度下降。

关键词

引用

@article{arxiv.2106.01335,
  title  = {On the Distribution, Sparsity, and Inference-time Quantization of Attention Values in Transformers},
  author = {Tianchu Ji and Shraddhan Jain and Michael Ferdman and Peter Milder and H. Andrew Schwartz and Niranjan Balasubramanian},
  journal= {arXiv preprint arXiv:2106.01335},
  year   = {2021}
}