Poly-EPO:训练探索性推理模型
人工智能
2026-05-06 v3
摘要
探索是从经验中学习的基石:它使智能体能够找到复杂问题的解决方案,泛化到新问题,并随测试时间计算的增长而提升性能。本文提出了一个用于后训练语言模型 (LM) 的框架,显式鼓励乐观的探索,并促进探索与剥削之间的协同。核心思想是训练 LM 生成一组在奖励函数下准确且在推理策略上具有探索性的响应。我们首先发展了一种通用的 LM 优化配方,针对任意目标函数进行集合强化学习 (set RL),通过修改优势计算来适应标准 RL 算法。随后,我们提出了多色探索策略优化 (Poly-EPO),该框架以显式协同探索与剥削的目标实现此框架。在各种推理基准测试中,我们展示 Poly-EPO 在泛化性方面具有改进,证据包括更高的 pass@ 覆盖率,模型生成的多样性得到保持,并有效地随测试时间计算的增长而提升性能。
引用
@article{arxiv.2604.17654,
title = {Poly-EPO: Training Exploratory Reasoning Models},
author = {Ifdita Hasan Orney and Jubayer Ibn Hamid and Shreya S Ramanujam and Shirley Wu and Hengyuan Hu and Noah Goodman and Dorsa Sadigh and Chelsea Finn},
journal= {arXiv preprint arXiv:2604.17654},
year = {2026}
}