中文

带交互式人类反馈的科研代码开发基准 RECODE-H

计算与语言 2025-10-27 v2 人工智能

摘要

大型语言模型 (LLM) 在支持科学研究实现方面显示出巨大的潜力,但其生成正确且可执行代码的能力仍受限。现有工作大多采用单次设置,忽视科研开发中真实工作流程的迭代性和反馈驱动性。为此,我们提出 RECODE-H,包含 102 个来自科研论文和仓库的任务,通过与 LLM 模拟的人类反馈进行多轮交互来评估 LLM 代理。基准包含结构化指令、单元测试以及五级反馈层次,以反映真实研究员与代理之间的协作。我们进一步提出 ReCodeAgent 框架,将反馈集成到迭代代码生成中。使用 GPT-5、Claude-Sonnet-4、DeepSeek-V3.1 和 Gemini 2.5 等主流 LLM 实验显示,丰富的反馈显著提升性能,同时也凸显了在生成复杂科研代码方面的持续挑战。RECODE-H 为开发面向科研实现的自适应、反馈驱动型 LLM 代理奠定了基础。

关键词

引用

@article{arxiv.2510.06186,
  title  = {RECODE-H: A Benchmark for Research Code Development with Interactive Human Feedback},
  author = {Chunyu Miao and Henry Peng Zou and Yangning Li and Yankai Chen and Yibo Wang and Fangxin Wang and Yifan Li and Wooseong Yang and Bowei He and Xinni Zhang and Dianzhi Yu and Hanchen Yang and Hoang H Nguyen and Yue Zhou and Jie Yang and Jizhou Guo and Wenzhe Fan and Chin-Yuan Yeh and Panpan Meng and Liancheng Fang and Jinhu Qi and Wei-Chieh Huang and Zhengyao Gu and Yuwei Han and Langzhou He and Yuyao Yang and Yinghui Li and Hai-Tao Zheng and Xue Liu and Irwin King and Philip S. Yu},
  journal= {arXiv preprint arXiv:2510.06186},
  year   = {2025}
}

备注

Code and dataset are available at github.com/ChunyuMiao98/RECODE