叛逆学生:通过自蒸馈RLVR实现教师信号的逆向推理探索
机器学习
2026-05-12 v1 计算与语言
摘要
自蒸馈已成为微调大语言模型的强大框架,其中以额外信息为条件的教师指导没有该信息的学生,二者均来自同一模型。尽管这种指导在学生失败时有用,但在成功的 rollout 中,相同机制反而会覆盖学生的选择并抑制其自身的推理。因此,我们提出逆向读取原始自蒸馈信号:当学生沿着教师未曾预测的路径成功时,这些 token 反映了其自主驱动的推理。在此基础上,我们提出 RLRT(RLVR with Reversed Teacher),通过强化正确 rollout 中的这些 token 来增强 GRPO。我们将其解释为 RLVR 中一种新的探索形式:并非均匀多样性,而是以学生自身成功为基础的有价值探索。在 base、instruction-tuned 和 thinking-tuned Qwen3 checkpoint 上,RLRT 在自蒸馈和探索基线上均显著优于后者,确立了信息不对称作为 RLVR 新型、原则性设计轴。
引用
@article{arxiv.2605.10781,
title = {Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR},
author = {Jeonghye Kim and Jiwon Jeon and Dongsheng Li and Yuqing Yang},
journal= {arXiv preprint arXiv:2605.10781},
year = {2026}
}