中文

为何在蒸馏之前必须进行对齐:一个最小可行解释

机器学习 2025-09-30 v1

摘要

为提高效率,偏好对齐通常在紧凑的知识蒸馏(KD)模型上执行。我们认为,这种常见做法引入了显著的局限性,忽略了对齐参考模型的一个关键属性:其分布性召回能力。我们展示,标准的 KD -> Align 工作流程会削弱模型对少数且理想行为的对齐能力,即便在强烈的偏好信号下也是如此。我们反证,颠倒管道(即 Align -> KD)是必需的:必须先在高召回率的参考模型上进行对齐,再进行蒸馏。我们的贡献有三方面:首先,我们提供了参考模型如何在根本层面约束偏好对齐目标的最小可行解释。其次,我们在可控的高斯混合模型实验中验证了这一理论,发现低召回 anchoring 一致导致模型性能次优。最后,我们在 SmolLM2 系列中验证了同样的现象:在 KD 后进行对齐的模型未能有效对齐目标行为,导致奖励值和目标精度显著下降。相比之下,我们提出的 Align -> KD 流程能稳健地对齐这些行为,得到在目标导向指标和方差更低的模型。总体而言,这些结果确立了参考模型召回率是对齐设计的首要选择,提出了一个清晰原则:对齐必须在蒸馏之前进行。

关键词

引用

@article{arxiv.2509.23667,
  title  = {Why Alignment Must Precede Distillation: A Minimal Working Explanation},
  author = {Sungmin Cha and Kyunghyun Cho},
  journal= {arXiv preprint arXiv:2509.23667},
  year   = {2025}
}

备注

Preprint