LAB-Bench:衡量语言模型在生物学研究中的能力
人工智能
2024-07-18 v3
摘要
对前沿大型语言模型(LLM)和LLM-augmented 系统的广泛乐观认为其有潜力在跨学科领域加速科学发现。今天,已存在许多基准用于衡量LLM 在 textbook 风格科学问题上的知识和推理能力,但几乎没有基准旨在评估语言模型在科学研究中所需的实用任务上的表现,如文献检索、方案规划和数据分析。为了构建此类基准,作为一步,我们介绍了 Language Agent Biology Benchmark (LAB-Bench),一个包含2400多个以上选择题的数据集,用于评估AI 系统在广泛的实用生物学研究能力上,包括对文献的记忆与推理、图表解释、数据库访问与导航、以及DNA 和蛋白质序列的理解与操作。重要的是,与以前的科学基准不同,我们期望能够在更困难的LAB-Bench 任务上持续取得高分的AI 系统将作为文献检索和分子克隆等领域的有用助理。作为对前沿语言模型新兴科学任务能力的初始评估,我们测量了几种模型在本基准上的表现,并报告了相对于人类专家生物学研究人员的结果。我们将继续更新和扩展LAB-Bench,预计它将作为开发自动化研究系统的工具。一个公开的子集可在以下URL 提供: https://huggingface.co/datasets/futurehouse/lab-bench
引用
@article{arxiv.2407.10362,
title = {LAB-Bench: Measuring Capabilities of Language Models for Biology Research},
author = {Jon M. Laurent and Joseph D. Janizek and Michael Ruzo and Michaela M. Hinks and Michael J. Hammerling and Siddharth Narayanan and Manvitha Ponnapati and Andrew D. White and Samuel G. Rodriques},
journal= {arXiv preprint arXiv:2407.10362},
year = {2024}
}
备注
40 pages, 5 main figures, 1 main table, 2 supplemental figures, 4 supplemental tables. Submitted to NeurIPS 2024 Datasets and Benchmarks track (in review)