Compacter:高效的低秩超复数适配器层
计算与语言
2021-11-30 v2
摘要
通过微调将大规模预训练语言模型适配到下游任务,是在 NLP 基准上取得最先进性能的标准方法。然而,对具有数百万或数十亿参数的模型的所有权重进行微调,样本效率低,在低资源环境下不稳定,并且浪费,因为它需要为每个任务存储单独的模型副本。近期工作开发了参数高效微调方法,但这些方法要么仍需要相对大量的参数,要么性能不及标准微调。在这项工作中,我们提出 Compacter,一种相比先前工作在任务性能与可训练参数数量之间具有更好权衡的大规模语言模型微调方法。Compacter 通过构建于适配器、低秩优化和参数化超复数乘法层的思想之上来实现这一点。具体而言,Compacter 将任务特定的权重矩阵插入预训练模型的权重中,这些矩阵被高效地计算为共享“慢”权重与每个 Compacter 层定义的“快”秩一矩阵之间的克罗内克积之和。通过仅训练预训练模型 0.047% 的参数,Compacter 在 GLUE 上表现与标准微调相当,并在 SuperGLUE 和低资源环境下优于标准微调。我们的代码公开于~\url{https://github.com/rabeehk/compacter}。
引用
@article{arxiv.2106.04647,
title = {Compacter: Efficient Low-Rank Hypercomplex Adapter Layers},
author = {Rabeeh Karimi Mahabadi and James Henderson and Sebastian Ruder},
journal= {arXiv preprint arXiv:2106.04647},
year = {2021}
}
备注
accepted in NeurIPS, 2021