中文

CodeFort:面向代码生成模型的鲁棒训练

软件工程 2024-10-30 v2 人工智能

摘要

代码生成模型对小扰动不具鲁棒性,常导致错误生成并显著降低模型性能。虽然提升代码生成模型鲁棒性对增强实际应用用户体验至关重要,但现有研究未能解决此问题。为填补这一空白,我们提出CodeFort框架,通过泛化多种代码扰动丰富训练数据,实现多种鲁棒训练策略,包括数据增强、批处理增强、对抗逻辑配对和对比学习,旨在支持高吞吐训练。广泛评估表明,我们将基线CodeGen模型的平均鲁棒通过率从14.79%提升至21.74%,对代码语法扰动的鲁棒性下降率从95.02%降至54.95%。

关键词

引用

@article{arxiv.2405.01567,
  title  = {CodeFort: Robust Training for Code Generation Models},
  author = {Yuhao Zhang and Shiqi Wang and Haifeng Qian and Zijian Wang and Mingyue Shang and Linbo Liu and Sanjay Krishna Gouda and Baishakhi Ray and Murali Krishna Ramanathan and Xiaofei Ma and Anoop Deoras},
  journal= {arXiv preprint arXiv:2405.01567},
  year   = {2024}
}