中文

Delulu:用于 Fill-in-the-Middle 任务中代码幻觉检测的已验证多语言基准测试

机器学习 2026-05-12 v1 人工智能

摘要

用于代码生成的大型语言模型在 Fill-in-the-Middle (FIM) 任务中经常产生幻觉——即看似合理但不正确的补全,如虚构的 API 方法、无效参数、未定义变量或不存在的导入。这些失败能通过表面审查,却会引入运行时错误。我们引入了 Delulu,一个包含 1,951 个 FIM 样本的已验证多语言基准测试,涵盖 7 种语言和 4 种幻觉类型。样本通过对抗性流水线构建:前沿 LLM 生成看似合理的幻觉,四个多样的评判模型对其进行评估,基于嵌入的聚类挖掘难度逐渐增加的样本,自包含的 Docker 容器验证标准补全能够编译而幻觉变体会产生预期的运行时错误,最后由人类专家审查移除任何剩余有偏见或易于判定的样本。我们评估了来自五个家族、参数量涵盖 0.5B-32B 的 11 个开放权重 FIM 模型:一个六点 Qwen2.5-Coder 缩放系列,以及一个跨家族系列 (CodeLlama, DeepSeek-Coder-V2, StarCoder2)。最强模型仅达到 84.5% 的 pass@1,没有家族超过 0.77 的编辑相似度,且每个家族都在相当比例的样本上产生了与幻觉一致的补全,这证实了 Delulu 所揭示的难度是任务固有的,而非特定于某个家族。我们在 https://github.com/microsoft/delulu 发布了该基准测试、容器和评估框架。

关键词

引用

@article{arxiv.2605.07024,
  title  = {Delulu: A Verified Multi-Lingual Benchmark for Code Hallucination Detection in Fill-in-the-Middle Tasks},
  author = {Mahdi Erfanian and Nelson Daniel Troncoso and Aashna Garg and Amabel Gale and Xiaoyu Liu and Pareesa Ameneh Golnari and Shengyu Fu},
  journal= {arXiv preprint arXiv:2605.07024},
  year   = {2026}
}