中文

LEAP:LLM 在迭代科学设计中的轨迹级评估

机器学习 2026-05-18 v1 人工智能

摘要

大型语言模型正日益被部署于自主实验室,认为其域先验和对迭代反馈的推理能力使其在迭代次数上优于仅依赖反馈的基线方法。当前迭代科学设计基准仅在固定时点评估结果快照,未能衡量学习轨迹,而轨迹正是衡量学习效率的关键——每节省一次迭代都是实际的成本与时间节省。为此,我们检视了三种评估选择如何改变人们对 LLM 学习效率的评估结论:测量什么、与何种基线比较、依据什么来审计。我们引入 LEAPBench,即 Learning Efficiency in Adaptive Processes,一个包含 55 项任务的框架,将最佳即时曲线下面积(AUC)轨迹指标与经典贝叶斯优化参考相结合,并以已发表文献为审计依据。我们将其应用于八种当代 LLM,切换从最终结果到轨迹计分在相同时点评估下,会改变 53% 任务的最佳模型决定,并暴露了结果导向计分所忽视的效率收益。LLM 不超过经典贝叶斯基线。在 16 项生物学任务中,当 oracle 的奖励信号与已发表最佳设计的配置一致时,领域感知提示下的 LLM 选择在第 30 次迭代时约少匹配已发表最佳设计 10 个百分点。这种模式在文献典型配置与已发表最佳配置发生分歧的 6 项任务中最为尖锐,领域中性提示在所有 6 项任务中都更常匹配已发表最佳设计。轨迹指标也可作为可行的训练目标。以该指标作为奖励的离线强化学习在 21 项保留测试中提升了 14 项任务的性能。

关键词

引用

@article{arxiv.2605.15341,
  title  = {LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design},
  author = {Marilyn Zhang and Tianfeng Chen and Fabián Barzuna and Ankita Rathod and Mark E. Whiting},
  journal= {arXiv preprint arXiv:2605.15341},
  year   = {2026}
}