BioPlanner:在生物学实验方案规划上对 LLM 的自动评估
计算与语言
2023-10-17 v1 人工智能
机器人学
摘要
自动生成准确的科学实验方案的能力,将代表科学自动化的重要一步。大语言模型(LLMs)在问答、连贯文本与代码生成等广泛任务上具备令人印象深刻的性能。然而,LLM 可能在多步问题与长期规划上遇到困难,而这二者对设计科学实验至关重要。此外,科学方案准确性的评估颇具挑战,因为实验可用多种不同方式正确描述、需专家知识评判,且通常无法自动执行。在此我们提出一个针对实验方案规划任务的自动评估框架,并引入 BioProt:一个带有相应伪代码表示的生物学方案数据集。为衡量生成科学方案的性能,我们使用 LLM 将自然语言方案转为伪代码,再评估 LLM 根据高层描述与一组许可伪代码函数重建伪代码的能力。我们在此任务上评估 GPT-3 与 GPT-4 并探究其鲁棒性。我们通过检索伪代码生成准确的新方案,在生物学实验室成功运行了所生成方案,由此外部验证了文本伪代码表示的效用。我们的框架可扩展至其他科学领域或缺乏自动评估的其他领域的语言模型规划能力评估与改进。
引用
@article{arxiv.2310.10632,
title = {BioPlanner: Automatic Evaluation of LLMs on Protocol Planning in Biology},
author = {Odhran O'Donoghue and Aleksandar Shtedritski and John Ginger and Ralph Abboud and Ali Essa Ghareeb and Justin Booth and Samuel G Rodriques},
journal= {arXiv preprint arXiv:2310.10632},
year = {2023}
}
备注
EMNLP 2023. Dataset and code: https://github.com/bioplanner/bioplanner