中文

Prism:基于蒙特卡洛树搜索树的 LLM 代码生成动态灵活基准测试

人工智能 2025-04-11 v2 机器学习 软件工程

摘要

大型语言模型(LLM)的快速发展已超越传统评估方法。静态基准测试无法捕捉LLM能力的深度和广度,最终会变得过时,而大多数动态方法要么过度依赖LLM-based评估,要么受限于预定义的测试集。我们提出Prism,一个灵活、动态的基准测试框架,用于全面评估LLM。Prism基于三个关键组件:(1) 基于树的状态表示将评估建模为马尔可夫决策过程,(2) 适用于揭示挑战性评估情景的蒙特卡洛树搜索算法,(3) 多智能体评估管道使可同时评估多种能力。为确保评估的稳健性,Prism将树探索模式的结构度量与不同难度水平上的绩效指标相结合,提供对错误模式、测试覆盖和解决方案方法的详细诊断。通过在五个最先进的LLM上的大规模实验,我们分析了模型架构和规模如何影响代码生成在不同任务难度下的性能。我们的结果表明,Prism作为随模型进步而演进的动态基准测试,能够提供对其局限性的更深入见解。

关键词

引用

@article{arxiv.2504.05500,
  title  = {Prism: Dynamic and Flexible Benchmarking of LLMs Code Generation with Monte Carlo Tree Search},
  author = {Vahid Majdinasab and Amin Nikanjam and Foutse Khomh},
  journal= {arXiv preprint arXiv:2504.05500},
  year   = {2025}
}