中文

后训练大语言模型的塑性与稳定性

机器学习 2026-02-09 v1

摘要

训练稳定性是Group Relative Policy Optimization(GRPO)的一个关键瓶颈,常表现为推理塑性与通用能力保留之间的权衡。我们识别出根本原因是塑性梯度与稳定梯度之间的几何冲突,导致破坏性干扰。关键的是,我们认为确定性投影方法对GRPO而言次优,因为忽略了基于组的梯度估计的内在随机性。为此,我们提出了概率冲突解决(PCR),一种贝叶斯框架将梯度建模为随机变量。PCR通过不确定性感知的"软投影"机制动态仲裁冲突,优化信噪比。广泛的实验表明,PCR显著平滑了训练轨迹,在各种推理任务中实现卓越的性能。

关键词

引用

@article{arxiv.2602.06453,
  title  = {On the Plasticity and Stability for Post-Training Large Language Models},
  author = {Wenwen Qiang and Ziyin Gu and Jiahuan Zhou and Jie Hu and Jingyao Wang and Changwen Zheng and Hui Xiong},
  journal= {arXiv preprint arXiv:2602.06453},
  year   = {2026}
}