HEAL:用于推理蒸馏的后见之明熵辅助学习
人工智能
2026-03-12 v1 机器学习
摘要
从大型推理模型(LRM)向较小模型蒸馏推理能力通常受到拒绝采样局限性的制约。标准方法将教师模型视为静态过滤器,丢弃了教师模型无法独立探索有效解的复杂“边缘案例”问题,从而为学生模型人为地制造了“教师天花板”。在这项工作中,我们提出了后见之明熵辅助学习(HEAL),一个无需强化学习(RL-free)的框架,旨在弥合这一推理差距。借鉴最近发展区(ZPD)的教育理论,HEAL 协同了三个核心模块:(1)引导式熵辅助修复(GEAR),一种主动干预机制,通过熵动力学检测关键推理断点并注入有针对性的后见之明提示以修复断裂的轨迹;(2)困惑度-不确定性比率估计器(PURE),一个严格的过滤协议,将真正的认知突破与虚假捷径解耦;(3)渐进式答案引导课程演化(PACE),一个三阶段蒸馏策略,组织从基础对齐到前沿突破的训练。在多个基准上的大量实验表明,HEAL 显著优于传统的监督微调(SFT)蒸馏和其他基线方法。
引用
@article{arxiv.2603.10359,
title = {HEAL: Hindsight Entropy-Assisted Learning for Reasoning Distillation},
author = {Wenjing Zhang and Jiangze Yan and Jieyun Huang and Yi Shen and Shuming Shi and Ping Chen and Ning Wang and Zhaoxiang Liu and Kai Wang and Shiguo Lian},
journal= {arXiv preprint arXiv:2603.10359},
year = {2026}
}
备注
11 pages,5 figures