中文

Poly-EPO:训练探索性推理模型

人工智能 2026-05-06 v3

摘要

探索是从经验中学习的基石:它使智能体能够找到复杂问题的解决方案,泛化到新问题,并随测试时间计算的增长而提升性能。本文提出了一个用于后训练语言模型 (LM) 的框架,显式鼓励乐观的探索,并促进探索与剥削之间的协同。核心思想是训练 LM 生成一组在奖励函数下准确且在推理策略上具有探索性的响应。我们首先发展了一种通用的 LM 优化配方,针对任意目标函数进行集合强化学习 (set RL),通过修改优势计算来适应标准 RL 算法。随后,我们提出了多色探索策略优化 (Poly-EPO),该框架以显式协同探索与剥削的目标实现此框架。在各种推理基准测试中,我们展示 Poly-EPO 在泛化性方面具有改进,证据包括更高的 pass@kk 覆盖率,模型生成的多样性得到保持,并有效地随测试时间计算的增长而提升性能。

关键词

引用

@article{arxiv.2604.17654,
  title  = {Poly-EPO: Training Exploratory Reasoning Models},
  author = {Ifdita Hasan Orney and Jubayer Ibn Hamid and Shreya S Ramanujam and Shirley Wu and Hengyuan Hu and Noah Goodman and Dorsa Sadigh and Chelsea Finn},
  journal= {arXiv preprint arXiv:2604.17654},
  year   = {2026}
}