中文

ELABORATION:面向人-大语言模型竞赛编程的综合基准

人工智能 2025-05-23 v1

摘要

尽管近期研究日益强调人-大语言模型(LLM)协作在竞赛编程中的价值,并提出了众多经验性方法,但由于现有研究碎片化且使用多样化、针对特定应用的人类反馈,全面理解仍然难以实现。因此,我们的工作具有三重目的:第一,我们提出了首个整合整个编程过程的人类反馈分类法,这有助于进行细粒度评估。第二,我们引入了 ELABORATIONSET,一个专为人-LLM 协作设计的新型编程数据集,经过精心标注,能够支持大规模模拟人类反馈,并促进成本效益高的真实人类交互研究。第三,我们引入了 ELABORATION,一个旨在促进对人-LLM 竞赛编程进行全面评估的新型基准。借助 ELABORATION,我们精准定位了现有方法的优势与不足,从而为未来的改进奠定了基础。我们的代码和数据集可在 https://github.com/SCUNLP/ELABORATION 获取。

关键词

引用

@article{arxiv.2505.16667,
  title  = {ELABORATION: A Comprehensive Benchmark on Human-LLM Competitive Programming},
  author = {Xinwei Yang and Zhaofeng Liu and Chen Huang and Jiashuai Zhang and Tong Zhang and Yifan Zhang and Wenqiang Lei},
  journal= {arXiv preprint arXiv:2505.16667},
  year   = {2025}
}

备注

ACL 2025 Main. Our code and dataset are available at https://github.com/SCUNLP/ELABORATION