通过结构化组件奖励机制释放生物实验程序生成的科学推理能力
人工智能
2026-01-28 v2 计算与语言
摘要
可重复的科学基础在于能够精确、逻辑有序且可执行的程序。通过自然语言查询自动生成这些程序可大大提高复现过程的效率。然而, 当前领先的大型语言模型(LLM)常常生成不完整或不一致的程序, 限制了其实用性。为解决此限制, 我们首先引入SciRecipe, 一个规模庞大的结构化程序数据集, 包含超过12K个覆盖27个生物学子领域的程序, 涵盖理解与问题解决任务。为进一步提高程序生成效果, 我们提出了"草图-填充"(Sketch-and-Fill)范式, 将分析、结构化与表达分离, 以确保每一步都明确且可验证。配合此, 我们设计了基于结构化组件的奖励机制, 评估步骤粒度、动作顺序和语义忠实度, 将模型优化与实验可靠性对齐。基于这些组件, 我们发展了Thoth, 通过阶段性的知识到行动(Knowledge-to-Action)训练过程实现, 从知识获取到操作推理最终走向稳健、可执行的程序生成。在多个基准测试中, Thoth consistently 超过了包括专有和开源LLM在内的各类模型, 在步骤对齐、逻辑排序和语义准确性方面实现显著提升。我们的做法为可靠的科学助手提供了可能, 这些助手桥接知识与实验执行。所有数据、代码和模型将公开发布。
引用
@article{arxiv.2510.15600,
title = {Unleashing Scientific Reasoning for Bio-experimental Protocol Generation via Structured Component-based Reward Mechanism},
author = {Haoran Sun and Yankai Jiang and Zhenyu Tang and Yaning Pan and Shuang Gu and Zekai Lin and Lilong Wang and Wenjie Lou and Lei Liu and Lei Bai and Xiaosong Wang},
journal= {arXiv preprint arXiv:2510.15600},
year = {2026}
}