面向细粒度代码指令遵循与多轮反馈的分层可演进基准
软件工程
2025-07-02 v1
摘要
大型语言模型(LLM)在代码生成方面取得了显著进步,然而它们遵循具有分层和多样化约束的复杂编程指令的能力仍未得到充分探索。现有基准通常优先考虑功能正确性,而忽略了现实世界开发中发现的细微需求。我们引入了MultiCodeIF,一个全面的基准,旨在从多个维度评估代码生成中的指令遵循:约束类型、层级结构和迭代优化。基于9个类别和27种约束类型的结构化分类体系,MultiCodeIF能够对功能性和非功能性指令遵循进行细粒度评估。利用自动化流水线ConstraGen,我们合成并演进了源自14种编程语言的2,021个代码任务,通过反馈驱动的任务变体支持多轮评估。对六个最先进的LLM的经验评估揭示了显著的性能差异。表现最好的模型Claude-3-7-Sonnet实现了63.0%的平均约束满足率,而像Qwen3-1.7B这样较小的模型则降至44.8%。模型在显式约束上表现良好,但在隐式或抽象约束上表现不佳。具有多个层级约束的任务显著降低了模型成功率,从单层场景的54.5%降至多层场景的仅18.8%。然而,结构化反馈能够实现渐进式改进:在四轮迭代优化中,平均约束满足率从63.0%上升至83.4%。MultiCodeIF提供了一个可扩展、约束感知且对反馈敏感的框架,用于在现实代码生成场景下对LLM进行基准测试,弥合了合成评估与现实指令复杂性之间的差距。完整的基准数据集、评估流水线和源代码可在 https://github.com/SYSUSELab/MultiCodeIF 获取。
引用
@article{arxiv.2507.00699,
title = {A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback},
author = {Guoliang Duan and Mingwei Liu and Yanlin Wang and Chong Wang and Xin Peng and Zibin Zheng},
journal= {arXiv preprint arXiv:2507.00699},
year = {2025}
}