SciCode:由科学家精选的研究编码基准
人工智能
2024-07-19 v1 计算与语言
摘要
随着语言模型(LM)在诸多具有挑战性的任务上超越平均人类水平,开发具有挑战性、高质量且贴近现实的评估体系日益困难。为此,我们检视了 LM 在解决实际科学研究问题时生成代码的能力。我们邀请科学家与 AI 研究者共同参与数学、物理、化学、生物学和材料科学等 16 个自然科学子领域的建构工作,创建了一个由科学家精选的编码基准——SciCode。SciCode 中的问题自然分解为多个子问题,每个子问题都涉及知识回忆、推理与代码综合。总体而言,SciCode 包含 338 个子问题,这些子问题源自 80 个具有挑战性的主问题。该基准提供可选描述,说明有用的科学背景信息,并附有科学家标注的金标准解决方案与测试用例,以便进行评估。在所测试的模型中,表现最佳的 Claude3.5-Sonnet 仅能在最真实的情景下解决约 4.6% 的问题。我们认为,SciCode 不仅展示了当代 LM 在成为有用科学助手方面的进展,也为未来科学 AI 的发展与评估指明了方向。
引用
@article{arxiv.2407.13168,
title = {SciCode: A Research Coding Benchmark Curated by Scientists},
author = {Minyang Tian and Luyu Gao and Shizhuo Dylan Zhang and Xinan Chen and Cunwei Fan and Xuefei Guo and Roland Haas and Pan Ji and Kittithat Krongchon and Yao Li and Shengyan Liu and Di Luo and Yutao Ma and Hao Tong and Kha Trinh and Chenyu Tian and Zihan Wang and Bohao Wu and Yanyu Xiong and Shengzhu Yin and Minhui Zhu and Kilian Lieret and Yanxin Lu and Genglin Liu and Yufeng Du and Tianhua Tao and Ofir Press and Jamie Callan and Eliu Huerta and Hao Peng},
journal= {arXiv preprint arXiv:2407.13168},
year = {2024}
}
备注
25 pages, 9 figures, 7 tables