TaskEval:评估大型语言模型代码生成任务难度的方法
软件工程
2025-10-27 v3 人工智能
摘要
大型语言模型(LLM)在代码生成等代码相关任务上表现出色,但基准评估往往忽略任务特征,如难度。此外,基准测试通常使用单一提示词描述任务来构建,而提示词的表述方式对结果有深远影响。本文提出了一种通用方法 TaskEval,一个利用多样化提示词和项目反应理论(IRT)来高效评估 LLM 能力与基准任务特征的框架,从而加深对其性能的理解。本文使用两个代码生成基准测试 HumanEval+ 和 ClassEval,以及 8 个代码生成 LLM,展示了 TaskEval 能够刻画任务的特征。通过主题分析,我们识别并分析了基准测试中 17 个和 21 个主题。我们还将任务特征与 LLM 使用的编程结构(如变量赋值、条件语句等)进行交叉分析,强调了某些与任务难度相关的模式。最后,我们对人工标注者与 LLM 的任务难度评估进行了比较。作为当前基准评估工作的补充,TaskEval 可以帮助研究人员和实践者更好地评估 LLM。任务特征可用于识别现有基准测试的不足或改进 LLM 的评估。
引用
@article{arxiv.2407.21227,
title = {TaskEval: Assessing Difficulty of Code Generation Tasks for Large Language Models},
author = {Florian Tambon and Amin Nikanjam and Cyrine Zid and Foutse Khomh and Giuliano Antoniol},
journal= {arXiv preprint arXiv:2407.21227},
year = {2025}
}
备注
Accepted ACM Transactions on Software Engineering and Methodology