中文

面向科学发现的评估驱动扩展

机器学习 2026-04-22 v1 人工智能

摘要

语言模型日益增多地用于科学发现,以生成假设、提出候选解决方案、实现系统并不断迭代地细化它们。在这些试错循环的核心是评估:通过验证器、仿真器或任务特定评分函数获取候选解决方案反馈的过程。虽然先前工作已强调评估的重要性,但尚未明确形式化如何在原则且有效的方式下扩展评估驱动的发现循环以推动科学发现边界,这一问题本文旨在解决。我们引入Simple Test-time Evaluation-driven Scaling(SimpleTES),一种通用的框架, strategically 组合并行探索、反馈驱动的细化和局部选择,揭示了沿正确维度扩展评估驱动的发现循环所释放的显著收益。在覆盖六个领域的21个科学问题上,SimpleTES使用gpt-oss模型发现了state-of-the-art解决方案,始终优于前沿模型基线和复杂的优化管道。特别是,我们将广泛使用的LASSO算法加快了2倍以上,设计了可减少门控开销24.5%的量子电路路由策略,发现了超越最佳已知结果的最低重叠构造。除新发现外,SimpleTES产生的轨迹级历史天然地监督反馈驱动的学习。当基于成功的轨迹进行后训练时,模型不仅在所见问题上提高效率,也在未见问题上实现泛化,发现基线模型难以发现的解决方案。总之,我们的结果确立了有效的评估驱动循环扩展作为推进LLM驱动科学发现的核心轴,并提供了一个简单而实用的框架来实现这些收益。

关键词

引用

@article{arxiv.2604.19341,
  title  = {Evaluation-driven Scaling for Scientific Discovery},
  author = {Haotian Ye and Haowei Lin and Jingyi Tang and Yizhen Luo and Caiyin Yang and Chang Su and Rahul Thapa and Rui Yang and Ruihua Liu and Zeyu Li and Chong Gao and Dachao Ding and Guangrong He and Miaolei Zhang and Lina Sun and Wenyang Wang and Yuchen Zhong and Zhuohao Shen and Di He and Jianzhu Ma and Stefano Ermon and Tongyang Li and Xiaowen Chu and James Zou and Yuzhi Xu},
  journal= {arXiv preprint arXiv:2604.19341},
  year   = {2026}
}