BEFT:低数据环境下语言模型的偏置高效微调
计算与语言
2026-04-21 v2 人工智能
机器学习
摘要
微调大型语言模型(LLM)的偏置项有望在保持竞争性性能的同时实现前所未有的参数效率,尤其是在低数据环境下。然而,微调不同偏置项(即查询、键或值投影中的 、 和 )与下游性能之间的联系至今仍不清楚。在本文中,我们研究了微调 、 和 与下游任务性能之间的联系。我们的核心发现是,与 和 相比,直接微调 通常在低数据环境下能带来更高的下游性能。我们在涵盖高达 6.7B 参数的纯编码器和纯解码器架构的广泛 LLM(包括无偏置 LLM)上,对这一独特性质进行了广泛评估。我们的结果为直接微调 在各种下游任务中的有效性提供了强有力的证据。实现代码可在 https://github.com/whubaichuan/BEFT 获取。
引用
@article{arxiv.2509.15974,
title = {BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data Regimes},
author = {Baichuan Huang and Ananth Balashankar and Amir Aminifar},
journal= {arXiv preprint arXiv:2509.15974},
year = {2026}
}