中文

CodeIF:评估大型语言模型代码生成指令遵循能力的基准测试

软件工程 2025-08-05 v3 机器学习

摘要

随着大型语言模型(LLM)的快速发展,针对代码生成任务的强大指令遵循能力的需求显著增长。代码生成不仅有助于更快的原型设计和自动化测试,还通过提高代码的可维护性和可重用性来增强开发人员的效率。本文引入了CodeIF,是第一个专为评估LLM在多样化代码生成场景中遵循任务导向指令能力的基准测试。CodeIF涵盖广泛的任务,包括函数合成、错误调试、算法重构和代码解释,从而提供了一套全面的测试套件,用于评估模型在不同复杂度水平和编程领域中的性能。我们对LLM进行了大规模实验,分析了它们在满足这些任务要求方面的优势和局限性。实验结果为理解当前模型与人类指令对齐程度,以及其生成一致性、可维护性和上下文相关性代码的能力提供了宝贵见解。我们的发现不仅凸显了指令遵循LLM在现代软件开发中发挥的关键作用,还揭示了提升其适应性、可靠性和在自动化代码生成中的整体效果的未来研究方向。CodeIF数据和代码公开可访问:https://github.com/lin-rany/codeIF

关键词

引用

@article{arxiv.2502.19166,
  title  = {CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation},
  author = {Kaiwen Yan and Hongcheng Guo and Xuanqing Shi and Shaosheng Cao and Donglin Di and Zhoujun Li},
  journal= {arXiv preprint arXiv:2502.19166},
  year   = {2025}
}

备注

Accepted as an ACL 2025 Industry Track paper (15 pages)