DISCOVERYWORLD:用于开发和评估自动科学发现代理的虚拟环境
人工智能
2024-10-10 v2 计算与语言
摘要
自动化的科学发现承诺加速跨学科领域的进展。然而,开发和评估AI代理在端到端科学推理能力具有挑战,因为实际实验往往昂贵或不可行。本文介绍 DISCOVERYWORLD,这是第一个用于开发和基准测试代理完成 novel 科学发现周期能力的虚拟环境。DISCOVERYWORLD 包含多种不同挑战,涵盖从射素年代测定、火箭科学到蛋白质组学等多个领域,以鼓励开发通用发现技能而非特定任务的解决方案。DISCOVERYWORLD 本身是一个低成本、模拟的、基于文本的环境(可选的 2D 视觉叠加层)。它包含 120 项不同的挑战任务,涵盖八个主题,每个主题有三个难度级别以及多个参数变体。每个任务都要求代理形成假设、设计和运行实验、分析结果并据此行动。DISCOVERYWORLD 进一步提供了三个用于评估绩效的自动指标,基于(a)任务完成情况、(b)采取的任务相关动作以及(c)发现的解释性知识。我们发现,一些强大的基线代理在大多数 DISCOVERYWORLD 任务上表现困难,这表明 DISCOVERYWORLD 捕捉到了发现的某些新挑战因素,从而 DISCOVERYWORLD 可能有助于加快近期开发和评估代理科学发现能力的进程。代码地址:www.github.com/allenai/discoveryworld
引用
@article{arxiv.2406.06769,
title = {DISCOVERYWORLD: A Virtual Environment for Developing and Evaluating Automated Scientific Discovery Agents},
author = {Peter Jansen and Marc-Alexandre Côté and Tushar Khot and Erin Bransom and Bhavana Dalvi Mishra and Bodhisattwa Prasad Majumder and Oyvind Tafjord and Peter Clark},
journal= {arXiv preprint arXiv:2406.06769},
year = {2024}
}
备注
Accepted to NeurIPS 2024 (Benchmark Track, Spotlight)