从模仿到歧视:通用课程优势机制以增强跨域推理任务
计算与语言
2025-12-16 v2
摘要
强化学习已成为后训练大型语言模型的范式,通过提升其推理能力。这些方法为每个样本计算优势值,反映其优于或劣于预期的表现,从而产生正负训练信号。然而,现有方法在早期阶段不加区分地混合这两种信号,可能导致指导模糊且收益有限。为此,我们提出CAPO(Curriculum Advantage Policy Optimization),一种基于优势信号的自适应课程机制。该机制以仅包含正优势样本的模仿学习为基础,以建立稳健的底层,然后引入负信号以培养判别能力,从而提高跨复杂情境的泛化能力。我们的方法与多种优化方法兼容,包括GRPO、PPO、RLOO和Reinforce++,在数学推理任务中始终实现稳定且显著的改进,并在多模态图形用户界面(GUI)推理场景中获得良好泛化,确立其作为一种通用且稳健的优化框架。
引用
@article{arxiv.2512.02580,
title = {From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks},
author = {Changpeng Yang and Jinyang Wu and Yuchen Liu and Shuai Zhang and Yang Li and Qiliang Liang and Hongzhen Wang and Shuai Nie and Jiaming Xu and Runyu Shi and Ying Huang and Guoquan Zhang},
journal= {arXiv preprint arXiv:2512.02580},
year = {2025}
}
备注
Accepted by AAAI 2026