中文

通过信息瓶颈突破 LLM 代码微调中的记忆障碍:提高泛化能力

机器学习 2025-10-21 v1 软件工程

摘要

通过监督微调 (FT) 将预训练的大型语言模型 (LLM) 适应代码领域已常用于代码生成。然而,我们识别出一种此前鲜有人注意的失败模式,即记忆障碍,表现为基座模型对下游代码数据的强记忆会陷入优化僵局,阻止标准 FT 有效获取新的、可泛化的代码知识。为克服这一障碍,我们提出了信息瓶颈 (IB) 指导下的微调方法,称为 IB-FT,通过在代码数据的隐藏表示上施加 IB 惩罚,以压缩潜在的、被记忆的特征,同时保留任务相关信息。在两个代码基准测试 (OriGen 和 Evol-CodeAlpaca-V1) 上的大规模实验表明,IB-FT 显著缓解了记忆障碍,提高了 top-1 性能 (Pass@11),并在更严格的多样本指标 Pass@k(m)k^{(m)}(即只有当至少 mmkk 个样本中的 mm 个通过单元测试时才算解决)方面表现出远远更稳定的提升,与传统 FT 相比表现更佳。

关键词

引用

@article{arxiv.2510.16022,
  title  = {Breaking Memorization Barriers in LLM Code Fine-Tuning via Information Bottleneck for Improved Generalization},
  author = {Changsheng Wang and Xin Chen and Sijia Liu and Ke Ding},
  journal= {arXiv preprint arXiv:2510.16022},
  year   = {2025}
}