微小注意力适配器:上下文比参数数量更重要
计算与语言
2022-11-04 v1 人工智能
机器学习
摘要
适配器微调是一种通过添加并微调少量新参数将预训练语言模型迁移到下游任务的范式。先前提出的适配器架构均为前馈神经网络。在本文中,我们研究了使用微小注意力——即每头维度极小的注意力——作为适配器的有效性。我们的微小注意力适配器学习直接以所有其他位置的隐藏状态为条件来修改每个位置的隐藏状态,这是先前提出的适配器所缺失的。此外,我们将它的多个注意力头视为专家混合,并提议在部署时对其权重取平均,从而进一步降低推理计算成本。在 GLUE 基准上,我们的微小注意力适配器仅更新 0.05% 的参数,便优于其他参数高效迁移学习方法以及全量微调。在 FewGLUE 基准上,其性能可与 GPT-3 和 PET 相媲美。
引用
@article{arxiv.2211.01979,
title = {Tiny-Attention Adapter: Contexts Are More Important Than the Number of Parameters},
author = {Hongyu Zhao and Hao Tan and Hongyuan Mei},
journal= {arXiv preprint arXiv:2211.01979},
year = {2022}
}
备注
EMNLP 2022 camera-ready