中文

非对称 On-Policy 蒸馏:在标记级别搭建剥离与模仿之间的桥梁

机器学习 2026-05-14 v3 人工智能

摘要

On-policy 蒸馏 (OPD) 通过在自身轨迹上训练学生并使用标记级教师反馈,常常优于 off-policy 蒸馏和标准强化学习。然而,我们发现其标准优势加权策略梯度存在三个结构性弱点:包括高方差更新、零优势区域的梯度消失,以及在纠正信号不足时存在的探索瓶颈。因此,我们提出了非对称 On-Policy 蒸馏 (AOPD),该方法在非正优势区域用局部散度最小化取代无效的负强化,而保留正强化学习。在数学推理基准测试中,AOPD 在强初始化和弱初始化下的平均提升分别为 4.09 / 8.34。AOPD 还能在训练期间保持更高的策略熵,并在顺序工具使用适应中表现更好的能力保留。

关键词

引用

@article{arxiv.2605.06387,
  title  = {Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level},
  author = {Nan Jia and Haojin Yang and Xing Ma and Jiesong Lian and Shuailiang Zhang and Weipeng Zhang and Ke Zeng and Xunliang Cai and Zequn Sun},
  journal= {arXiv preprint arXiv:2605.06387},
  year   = {2026}
}