群体模式选择优化:让 LRMs 为推理选取正确模式
人工智能
2026-01-13 v1
摘要
大规模推理模型(LRMs)表现出多样化的高层推理模式(例如直接解答、反思与验证、探索多个解答),但现有的训练配方隐含地偏向于有限的主导模式。通过系统分析,我们识别出这些模式在数学和科学基准测试中存在显著的准确率差异,表明模型的默认推理模式常常不适用于给定问题。为此,我们引入了群体模式选择优化(GPSO),这是一种强化学习框架,将 GRPO 扩展为包含多模式 rollout、基于验证器的 per-problem 最优模式选择,以及在优化期间的注意力掩码,以防止明确的模式后缀泄漏到所学策略中。通过探索多样化的推理策略并针对最有效的策略进行优化,GPSO 使模型能够内化问题特征到最优推理模式的映射。广泛的实验表明,GPSO 在各种模型 backbone 和基准测试上都能实现一致且显著的性能提升,有效缓解了模式亚最优问题,促进了更稳健、更具适应性的推理。所有数据和代码均在 https://github.com/wanghanbinpanda/GPSO 提供。
引用
@article{arxiv.2601.07238,
title = {Group Pattern Selection Optimization: Let LRMs Pick the Right Pattern for Reasoning},
author = {Hanbin Wang and Jingwei Song and Jinpeng Li and Fei Mi and Lifeng Shang},
journal= {arXiv preprint arXiv:2601.07238},
year = {2026}
}
备注
8 pages, 5 figures