中文

从输出到评估:原始指令微调代码 LLM 的输出是否足以用于填充中间代码生成?

软件工程 2025-06-11 v2 计算与语言

摘要

后处理对于 LLM 在填充中间(fill-in-the-middle, FIM)代码生成中的自动评估至关重要,因为原始输出中常包含多余代码。这种冗余生成表明模型对输出边界缺乏意识,需进行截断才能实现有效评估。然而,确定最佳截断策略往往颇为复杂,尤其当涉及多种编程语言时。本研究 investigates 指令微调 LLM 输出是否需要后处理。我们的发现表明,监督式微调显著提升了 FIM 代码生成,使 LLM 能够生成与周围上下文无缝集成的代码。在 HumanEval Infilling 和 SAFIM 基准测试中对我们微调的 Qwen2.5-Coder(基础版和指令版)模型进行评估,显示在不进行后处理的情况下性能提升,尤其当“中间”由完整的代码行组成时。然而,当“中间”为随机的代码片段时,仍需对 LLM 输出进行后处理。

关键词

引用

@article{arxiv.2505.18789,
  title  = {From Output to Evaluation: Does Raw Instruction-Tuned Code LLMs Output Suffice for Fill-in-the-Middle Code Generation?},
  author = {Wasi Uddin Ahmad and Somshubra Majumdar and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2505.18789},
  year   = {2025}
}

备注

Work in progress