中文

CSR-Bench:评估计算机科学研究仓库部署中 LLM 智能体的基准

软件工程 2025-02-13 v2 人工智能 机器学习

摘要

计算机科学研究项目日益增长的复杂性要求更有效的代码仓库部署工具。大型语言模型(LLM),如 Anthropic Claude 和 Meta Llama,已在计算机科学研究的各个领域展现出显著进步,包括自动化多样化的软件工程任务。为了评估 LLM 在处理研究项目复杂代码开发任务(特别是 NLP/CV/AI/ML/DM 主题)中的有效性,我们引入了 CSR-Bench,一个面向计算机科学研究项目的基准。该基准从准确性、效率和部署脚本质量等多个方面评估 LLM,旨在探索其自主进行计算机科学研究的潜力。我们还引入了一个新颖的框架 CSR-Agents,它利用多个 LLM 智能体来自动化部署计算机科学研究项目的 GitHub 代码仓库。具体来说,通过检查 Markdown 文件中的指令并解释仓库结构,该模型生成并迭代改进 bash 命令,以设置实验环境并部署代码来执行研究任务。CSR-Bench 的初步结果表明,LLM 智能体可以显著增强仓库部署的工作流程,从而提高开发者生产力并改善开发工作流程的管理。

关键词

引用

@article{arxiv.2502.06111,
  title  = {CSR-Bench: Benchmarking LLM Agents in Deployment of Computer Science Research Repositories},
  author = {Yijia Xiao and Runhui Wang and Luyang Kong and Davor Golac and Wei Wang},
  journal= {arXiv preprint arXiv:2502.06111},
  year   = {2025}
}