中文

PECC:问题提取与编码挑战

人工智能 2024-04-30 v1

摘要

大型语言模型(LLMs)的最新进展展示了其在代码生成、问题解决和推理等多种任务上的卓越能力。现有基准测试孤立地评估任务,然而 LLMs 在多大程度上能够理解散文式任务、识别潜在问题并生成适当的代码解决方案仍有待探索。为填补这一空白,我们引入了 PECC,这是一个源自 Advent Of Code (AoC) 挑战和 Project Euler 的新基准测试,包含 2396 个问题。与传统基准测试不同,PECC 要求 LLMs 解释嵌入叙述的问题、提取需求并生成可执行代码。我们数据集的一个关键特性是在基于聊天的评估中通过自然语言提示增加的复杂性,这反映了现实世界中指令的歧义性。结果显示,模型在叙述性问题和中性问题上的表现各异,其中 GPT-3.5-Turbo 在基于 Euler 数学的子集中面临特定挑战,通过了 50% 的 AoC 挑战,但仅通过了 8% 的 Euler 问题。通过探索 LLMs 能力的极限,我们的基准测试提供了一个框架,用于监控和评估 LLMs 作为通用问题求解器的后续进展。

关键词

引用

@article{arxiv.2404.18766,
  title  = {PECC: Problem Extraction and Coding Challenges},
  author = {Patrick Haller and Jonas Golde and Alan Akbik},
  journal= {arXiv preprint arXiv:2404.18766},
  year   = {2024}
}

备注

This paper got accepted at LREC-COLING 2024 (long)