中文

HUT:一种基于Hadamard更新变换的高效微调方法

计算与语言 2024-09-23 v1 人工智能

摘要

针对下游任务微调预训练语言模型已在自然语言处理中取得了令人瞩目的成果。然而,由于模型参数规模迅速增长,微调所有参数变得不切实际。为了解决这个问题,参数高效微调(PEFT)方法仅更新一部分参数。大多数PEFT方法(如LoRA)使用增量更新,即将学习到的权重矩阵增量添加到原始参数中。尽管有效,但这些方法在捕捉复杂参数动态方面存在局限性,并且未能保持原始参数与更新参数之间的强相关性。为了克服这些挑战,我们提出了直接的更新变换(UT)范式,该范式直接从原始参数构建到更新参数的变换。这种方法确保了原始参数和更新参数之间的相关性得以保留,从而利用了预训练期间学习到的语义特征。基于这一范式,我们提出了Hadamard更新变换(HUT)方法。HUT利用两个低秩矩阵的Hadamard变换高效地更新原始权重矩阵,提供了一种更具表达力和灵活性的更新机制。这使得HUT能够通过函数变换捕捉更丰富的参数特征,在降低计算复杂度的同时保持或提高模型质量。理论分析和在RoBERTa和GPT-2上的大量实验验证了HUT的有效性。结果表明,HUT在模型质量方面与其它PEFT方法表现相当或更优,同时显著降低了计算复杂度。

关键词

引用

@article{arxiv.2409.13501,
  title  = {HUT: A More Computation Efficient Fine-Tuning Method With Hadamard Updated Transformation},
  author = {Geyuan Zhang and Xiaofei Zhou and Chuheng Chen},
  journal= {arXiv preprint arXiv:2409.13501},
  year   = {2024}
}