中文

超越分数:探索提示细节对 LLM 代码生成的影响

计算与语言 2025-08-06 v1 机器学习 编程语言

摘要

面向通用基准测试(如 HumanEval)的 SOTA 大型语言模型 (LLM) 在 pass@1 上表现卓越,但在专业化套件(如 ParEval)上表现不佳。这种差异是由于 LLM 缺乏领域知识,还是由于提示细节不足?为解答此问题,我们引入 PartialOrderEval,该方法为任何代码生成基准测试增添一组从最简到最详尽的提示序列。我们将其应用于 HumanEval 和 ParEval 的两个子集(序列版和 OpenMP 版),衡量 pass@1 随提示细节程度的扩展趋势。我们使用 Llama-3.x 和 Qwen2.5-Coder 进行实验,发现不同任务对提示敏感度存在差异,定性分析表明,显式 I/O 规范、边界情况处理以及分步解构是提示细节改进的关键驱动因素。

关键词

引用

@article{arxiv.2508.03678,
  title  = {More Than a Score: Probing the Impact of Prompt Specificity on LLM Code Generation},
  author = {Yangtian Zi and Harshitha Menon and Arjun Guha},
  journal= {arXiv preprint arXiv:2508.03678},
  year   = {2025}
}