并非所有适配器都重要:基于选择性适配器冻结的内存高效语言模型微调
计算与语言
2025-05-16 v2 人工智能
机器学习
摘要
基于 Transformer 的大规模预训练模型取得了显著的成功。微调是利用这些模型处理下游任务的标准做法。在微调方法中,适配器微调通过引入轻量级可训练模块而保持大部分预训练参数冻结,提供了一种参数高效的微调方式。然而,现有的适配器微调方法仍会造成巨大的资源消耗。通过我们的调查研究,我们展示每个适配器在任务性能和资源消耗方面贡献不等。鼓励这一洞察后,我们提出了选择性适配器冻结方法(Selective Adapter FrEezing, SAFE),通过及时冻结重要性较小的适配器来减少不必要的资源消耗,同时保持性能。我们在实验中发现,SAFE 可将内存使用量、计算量和训练时间分别降低 42.85%、34.59% 和 11.82%,而实现的任务性能与基线相当或更好。我们还展示了SAFE 引入了正则化效果,从而平滑了损失景观,使模型能够通过避免尖锐的最小值来更好地实现泛化。
引用
@article{arxiv.2412.03587,
title = {Not All Adapters Matter: Selective Adapter Freezing for Memory-Efficient Fine-Tuning of Language Models},
author = {Hyegang Son and Yonglak Son and Changhoon Kim and Young Geun Kim},
journal= {arXiv preprint arXiv:2412.03587},
year = {2025}
}
备注
URL: https://aclanthology.org/2025.naacl-long.480/ Volume: Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers) Year: 2025 Address: Albuquerque, New Mexico