SimCT:用于跨分词器有策略蒸馏的捕获失去的监督信号
计算与语言
2026-05-22 v2
摘要
有策略蒸馏(OPD)是将教师行为传输到更小的学生模型的标准工具,但它隐含地假设教师和学生的预测在逐词上可比较,这一假设在两个模型对相同文本进行不同分词时便会失效。在异构分词器下,精确的共享词匹配会在词汇不一致的位置处静默地丢弃大量教师信号。我们提出简单跨分词器OPD(SimCT),通过扩大监督空间来恢复这些信号:除共享词外,SimCT在短的多词续写上比较教师和学生,这些续写都是两种分词器都能实现的,OPD损失函数本身保持不变。我们表明,这些单位是可 jointly tokenizable 的最细监督接口,粗糙的替代方案会去除对有策略学习有用的教师-学生区别。在三个异构教师-学生对上进行的数学推理和代码生成基准测试中,SimCT在共享词汇OPD和代表性的跨分词器基线上 consistently 获得提升,消融实验确认,改进来源于恢复被精确共享词匹配丢弃的监督信号。代码已公开。
引用
@article{arxiv.2605.07711,
title = {SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation},
author = {Jie Sun and Mao Zheng and Mingyang Song and Qiyong Zhong and Yilin Cheng and Bichuan Feng and Pengfei Liu and Junfeng Fang and Xiang Wang},
journal= {arXiv preprint arXiv:2605.07711},
year = {2026}
}
备注
4 figures, 6 tables, 28 pages