LLMs4Code 的模型编辑:我们离多少人?
摘要
针对代码的大型语言模型 (LLMs4Code) 已被发现在软件工程领域展现出卓越的性能,尤其在编码任务中表现突出。然而,即便是最先进的 LLMs4Code 也不可避免地包含错误或过时的代码知识。由于训练 LLMs4Code 的高昂成本,重新训练模型以修复这些有问题的代码知识是不可行的。模型编辑是近期被提出的用于有效且高效纠正 LLMs 中错误知识的技术领域,近期已提出各种模型编辑技术和基准测试。尽管如此,目前缺乏对现有模型编辑技术在 LLMs4Code 各种与代码相关任务中的性能进行全面比较和分析的系统性研究。为填补这一空白,我们首次系统性地研究了将最先进的模型编辑方法应用于修复 LLMs4Code 不准确知识的方式。为此,我们引入了一个名为 CLMEEval 的基准测试,包含两个数据集,即 CoNaLa-Edit (CNLE) 的 21K 多余代码生成样本和 CodeSearchNet-Edit (CSNE) 的 16K 多余代码摘要样本。借助 CLMEEval,我们在三个 LLMs4Code 上评估了六种先进的模型编辑技术:CodeLlama (7B)、CodeQwen1.5 (7B) 和 Stable-Code (3B)。我们的发现表明,外部记忆基于的 GRACE 方法在知识编辑有效性和特定性(编辑不影响非靶向知识)方面表现最佳,而通用性(编辑能否对其他语义相同输入进行泛化)是现有技术普遍面临的挑战。Furthermore, 通过深入的案例分析,我们引入了 GRACE 的增强版本 A-GRACE,该版本采用对比学习来更好地捕获输入的语义。
引用
@article{arxiv.2411.06638,
title = {Model Editing for LLMs4Code: How Far are We?},
author = {Xiaopeng Li and Shangwen Wang and Shasha Li and Jun Ma and Jie Yu and Xiaodong Liu and Jing Wang and Bin Ji and Weimin Zhang},
journal= {arXiv preprint arXiv:2411.06638},
year = {2024}
}
备注
Accepted by ICSE2025. The code is available at: https://github.com/xpq-tech/code-llmedit.git