划分-融合-征服:在多情景游戏中引发“啊哈时刻”
机器学习
2025-06-13 v4
摘要
大型语言模型(LLM)被观察到在强化学习(RL)过程中突然表现出类似由简单结果奖励触发的“啊哈时刻”的高级推理能力。虽然RL在数学、编码和视觉任务中已被证明有效地引发此类突破,但在多情景游戏中面临重大挑战。游戏规则、交互方式和环境复杂性的多样性常导致策略在某一情景中表现良好,却难以泛化至其他情景。单纯组合多情景训练会引入训练不稳定和性能不佳等额外挑战。为克服这些挑战,我们提出了划分-融合-征服(Divide-Fuse-Conquer)框架,以增强多情景RL的泛化能力。该方法通过基于规则和难度等特征对游戏进行启发式分组,然后为每组训练专门模型以在该组内游戏中表现卓越——我们称之为划分步骤。接着,将不同组的模型参数融合为新模型,并持续训练以征服所有组内的情景。18个TextArena游戏的实验表明,使用划分-融合-征服策略训练的Qwen2.5-32B-Align模型,其性能可与Claude3.5相当,取得7胜4平。我们希望我们的ethods能激发未来利用强化学习提升LLM泛化能力的研究。
引用
@article{arxiv.2505.16401,
title = {Divide-Fuse-Conquer: Eliciting "Aha Moments" in Multi-Scenario Games},
author = {Xiaoqing Zhang and Huabin Zheng and Ang Lv and Yuhan Liu and Zirui Song and Xiuying Chen and Rui Yan and Flood Sung},
journal= {arXiv preprint arXiv:2505.16401},
year = {2025}
}
备注
25 pages, 13 figures, and 8 tables