当困惑值失言时:面向生成的混合序列模型蒸馏
计算与语言
2026-03-30 v1 人工智能
摘要
通过蒸馏将预训练Transformer转化为更高效的混合模型是降低推理成本的有前景方法。然而,实现蒸馏模型的高质量生成需要精心设计学生架构与蒸馏过程。许多先前蒸馏工作通过排序候选答案的对数概率评估下游多选基准,而非要求自回归生成,这可能掩盖模型质量的重要差异。例如,我们表明一个 nearly 匹配其教师在对数概率评分上仅0.2 pp的7B参数蒸馏模型,在要求自回归生成答案时落后于教师20.8 pp。我们提出Hybrid Kimi Delta Attention(Hybrid-KDA)架构配合GenDistill多阶段蒸馏管线,贯彻以生成为导向的评估指导设计决策。将其应用于Qwen3-0.6B,我们系统性消融六个设计维度:训练目标、损失掩码、训练时长、数据集选择、参数冻结与架构选择。我们发现,对数概率评估一致低估了教师与学生之间的差距,某些情况下甚至会反转设计选择的排名,意味着仅凭困惑度评估得出的结论可能误导。在我们研究的因素中,数据集选择、仅完成掩码、以及在后训练期间冻结注意力层对生成质量影响最大。我们的最佳Hybrid-KDA模型在知识基准测试中保留86--90%的教师准确率,KV缓存内存降低最高75%,在128K上下文环境下首词延迟提升2--4倍。
引用
@article{arxiv.2603.26556,
title = {When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models},
author = {Juan Gabriel Kostelec and Xiang Wang and Axel Laborieux and Christos Sourmpis and Qinghai Guo},
journal= {arXiv preprint arXiv:2603.26556},
year = {2026}
}