中文

小规模迁移蒸馏:三 arc 负结果

机器学习 2026-04-15 v1 人工智能

摘要

我们动手通过四阶段的全 MIT 迁移蒸馏管线,在 0.6B 至 2.3B 有效参数的小型语言模型中训练行为取向(自我验证、不确定性承认、反馈整合)。随后进行推理时注意力头干预和冻结基座置信门控副车的实验。内部草稿报告称 Qwen3-0.6B 学生在 MCAS 上的提升为 +33.9 分,HumanEval 提升为 +15.3 分;但第二轮核查在出版前推翻了这两个数字。HumanEval 增量是截断副作用(n_predict=512),在 n_predict=1024 时反转为 -8.0 分;MCAS 增益在公平比较后消失。这种 falsification 触发了后续三个 arc。跨 (1) SFT/DPO LoRA 在三个模型家族和两个领域上进行,(2) 对 o_proj 进行推理时注意力头润饰,(3) 训练自由的冻结基座副车读取最终 token 隐藏状态 h_last,我们发现没有任何算子能够在不损害内容或退化为风格模仿的情况下移动 judge 测量的取向。这种失败在五个模型(Qwen3-0.6B、Qwen3-1.7B、Qwen3.5-0.8B、Gemma 4 E2B 和 SmolLM2-1.7B-Instruct)中保持一致。在分布外的交叉验证通过(AUC=0.683)在新提示词下坠落到随机水平(AUC=0.516)。我们贡献一个包含机制的三 arc 负结果,给出线性 h_last 探针的两种失效模式分类,以及将我们自身产生的假阳性类转化为可发表负结果的诚实 falsification 管线。作为独立发现,Gemma 4 E2B 在 Chef 领域 exhibits near-complete confidence-correctness decoupling(断言不对称 -0.009;该模型在正确与否时以 91% 的断言率)。

关键词

引用

@article{arxiv.2604.11867,
  title  = {Disposition Distillation at Small Scale: A Three-Arc Negative Result},
  author = {Hari Sadasivan},
  journal= {arXiv preprint arXiv:2604.11867},
  year   = {2026}
}

备注

16 pages, 4 figures