CodeMixBench:用于评估代码混合提示下大语言模型代码生成的基准
机器学习
2025-05-09 v1 计算与语言
摘要
大语言模型 (LLM) 在代码生成任务中取得了显著的成功,为代码补全、调试和编程辅助等各种应用提供了动力。然而,现有基准如 HumanEval、MBPP 和 BigCodeBench 主要仅评估英文提示下的 LLM,忽略了多语言开发者在与 LLM 交互时常使用代码混合语言的真实场景。为填补这一差距,我们引入 CodeMixBench,一个旨在评估 LLM 在代码混合提示下代码生成鲁健性的新型基准。基于 BigCodeBench,CodeMixBench 在提示自然语言部分引入受控代码混合 (CMD),覆盖三个语言对:Hinglish (印地语-英语)、西班牙语-英语和中文拼音-英语。我们全面评估了规模从 1.5B 到 15B 参数的多样化开源代码生成模型。结果表明,代码混合提示始终会导致 Pass@1 性能下降,性能下降幅度随 CMD 程度增加而增大,尤其是对较小模型而言。CodeMixBench 提供了一种真实实验框架,用于研究多语言代码生成,并揭示了构建在多样化语言环境下能够良好泛化的鲁健代码生成模型的新挑战和方向。
引用
@article{arxiv.2505.05063,
title = {CodeMixBench: Evaluating Large Language Models on Code Generation with Code-Mixed Prompts},
author = {Manik Sheokand and Parth Sawant},
journal= {arXiv preprint arXiv:2505.05063},
year = {2025}
}