通过解释性反转进行LLM蒸馏的强化学习精炼
计算与语言
2026-03-23 v1 人工智能
机器学习
摘要
从大语言模型(Large Language Models, LLMs)蒸馏出具有鲁健推理能力的小型、计算高效的学生模型仍是一个未解决的挑战。尽管近期的进展,蒸馏后的模型经常 suffer from superficial pattern memorization and subpar generalization。为克服这些限制,我们引入了一种新的蒸馏框架,超越简单的模仿,以培育更深层的概念理解。我们的框架具有两个关键创新。首先,为解决模式记忆问题,解释性反转(Explanatory Inversion, EI)生成针对性的“解释探针”,迫使学生阐述答案背后的底层逻辑,而不仅仅是记忆它。其次,为提高泛化能力,解释性GRPO(EXGRPO)使用一种带有新颖对话结构效用奖励的强化学习算法,显式奖励学生在这些探针之间保持连贯的推理过程。广泛的评估在12个数据集上表明,显著性提升。使用Gemma-7b作为学生模型,我们的方法在零shot性能上实现了平均20.39%的提升,在最先进的蒸馏基准上实现了6.02%的提升。此外,采用我们方法蒸馏的模型表现出卓越的训练效率(例如,使用10-25%的训练数据即可超越vanilla fine-tuning),并对跨域任务具有强大的泛化能力。实现代码已发布于https://github.com/Zhen-Tan-dmml/ExGRPO.git。
引用
@article{arxiv.2603.19266,
title = {Probing to Refine: Reinforcement Distillation of LLMs via Explanatory Inversion},
author = {Zhen Tan and Chengshuai Zhao and Song Wang and Jundong Li and Tianlong Chen and Huan Liu},
journal= {arXiv preprint arXiv:2603.19266},
year = {2026}
}
备注
Accepted to ICLR 2026