中文

Helix:面向开放性科学问题求解的进化型强化学习框架

机器学习 2026-03-10 v1

摘要

大型语言模型 (LLM) 具备推理能力已在解决复杂科学问题方面展现出巨大潜力。然而,这类任务本身具有领域性、非封闭和开放性,要求在广阔且灵活的解空间中进行探索。现有方法无论是纯粹基于学习的,还是依赖精心设计的工作流程,往往存在探索效率低和泛化性差的问题。为此,我们提出 HELIX——一个具备层次化进化强化学习框架,集成了情境经验 (in-context experiences)。HELIX 引入两个关键创新:(i) 通过情境学习拓宽探索,通过多样且高质量的候选解池来扩大解的范围;(ii) 通过迭代策略精炼实现强化学习,逐步提升解的质量。这种协同作用使得发现更高级的解成为可能。在圆形 packing 任务上,HELIX 仅使用 14B 参数模型即可实现最高纪录,半径之和为 2.63598308。在标准机器学习基准测试中,HELIX 进一步超越 GPT-4o,采用精心工程化的管线,使 Adult 和 Bank Marketing 数据集上的平均 F1 分数提升 5.95 分。

关键词

引用

@article{arxiv.2603.07642,
  title  = {Helix: Evolutionary Reinforcement Learning for Open-Ended Scientific Problem Solving},
  author = {Chang Su and Zhongkai Hao and Zhizhou Zhang and Zeyu Xia and Youjia Wu and Hang Su and Jun Zhu},
  journal= {arXiv preprint arXiv:2603.07642},
  year   = {2026}
}

备注

Accepted at ICLR 2026