确定性幻觉:解耦能力与校准在策略性蒸馏中的关系
机器学习
2026-04-21 v1 人工智能
摘要
策略性蒸馏(OPD)是后训练语言模型的重要范式之一。然而,我们发现存在一种规模定律的误校准现象:尽管OPD有效提升任务准确率,但系统性地将模型困在严重的过度自信状态。我们追溯了这一失败原因:信息不匹配。教师监督是在训练期间可用受特权上下文的条件下形成的,而部署模型只能使用部署时的上下文信息来报告置信度。我们在理论上形式化了这一观点,表明教师条件化的成功通常不是部署时置信度的有效目标,而有益的特权上下文会导致熵塌缩和系统性乐观偏差。为此,我们提出了一种校准感知的OPD框架CaOPD,该框架从模型 rollout 中估计经验置信度,将自报告置信度替换为来自学生的置信度目标,并通过相同的自蒸馏管道进行修订响应蒸馏。实验在各种模型和领域中表明,CaOPD在保持竞争能力的同时实现了校准的帕累托最优,能够在分布外和持续学习中实现稳健的泛化。我们的发现表明,能力蒸馏并不意味着已校准的置信度,而置信度应被视为后训练中的关键目标。代码:https://github.com/SalesforceAIResearch/CaOPD
引用
@article{arxiv.2604.16830,
title = {The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation},
author = {Jiaxin Zhang and Xiangyu Peng and Qinglin Chen and Qinyuan Ye and Caiming Xiong and Chien-Sheng Wu},
journal= {arXiv preprint arXiv:2604.16830},
year = {2026}
}
备注
40 pages, Code: https://github.com/SalesforceAIResearch/CaOPD