面向大策略发散下的基于教师引导的策略优化
机器学习
2026-05-29 v2 人工智能
摘要
基于教师的策略优化(TGPO)是一种在大策略发散下进行 on-policy 推理蒸馏的方法。现有的 OPD 方法依赖基于反向 KL(RKL)的教师监督,对来自学生策略采样的轨迹进行评估。然而,我们识别出了一个关键局限性:在教师-学生策略发散较大的情况下,RL 驱动的探索常常会产生超出教师分布的轨迹,从而导致无法提供有信息的负反馈。为此,我们提出了 Teacher-Guided Policy Optimization(TGPO),一种在大策略发散设置下仍然有效的 on-policy 推理蒸馈方法。不同于仅依赖评估性监督,TGPO 使用教师直接指导基于学生生成的上下文进行的 token 级生成;同时结合 RLVR 风格的轨迹级奖励,TGPO 将探索引导 toward 改进的后续生成。在推理基准测试中进行的实验表明,TGPO 在所有测试上都一致优于现有基于 RKL 的 OPD 方法,并且在不同的教师模型下保持稳健性。
引用
@article{arxiv.2605.13230,
title = {Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence},
author = {Xinyu Liu and Kechen Jiao and Chunyang Xiao and Runsong Zhao and Junhao Ruan and Bei Li and Jiahao Liu and Qifan Wang and Xin Chen and Jingang Wang and Chenglong Wang and Tong Xiao and JingBo Zhu},
journal= {arXiv preprint arXiv:2605.13230},
year = {2026}
}