随机遮蔽发现参数高效微调的获胜票
机器学习
2024-05-07 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)的微调成本高昂。参数高效微调(PEFT)通过训练仅部分参数来解决此问题,其成功揭示了预训练模型的表达性和灵活性。本文研究了PEFT的极限,通过进一步简化其设计并超出标准设置的训练参数数量。为此,我们采用随机遮蔽来微调预训练模型。尽管其简单性,本文表明随机遮蔽竟然相当有效:在更大的学习率下,随机遮蔽能够在各种任务上匹配标准PEFT算法如LoRA的性能,同时使用更少的可训练参数。我们提供了对随机遮蔽成功之经验与理论探索。我们表明,遮蔽会导致损失函数景观更平坦且更远的解,这允许且需要较大的学习率。
引用
@article{arxiv.2405.02596,
title = {Random Masking Finds Winning Tickets for Parameter Efficient Fine-tuning},
author = {Jing Xu and Jingzhao Zhang},
journal= {arXiv preprint arXiv:2405.02596},
year = {2024}
}
备注
ICML 2024