CTPD:跨分词器偏好蒸馏
计算与语言
2026-01-21 v1
摘要
虽然知识蒸馏在预训练和指令微调中得到了广泛应用,但其在将语言模型与人类偏好对齐方面的应用仍探索不足,尤其是在更现实的跨分词器设置下。教师模型和学生模型之间分词方案的互不兼容,在很大程度上阻碍了细粒度、白盒式的偏好信息蒸馏。为弥补这一差距,我们提出了跨分词器偏好蒸馏(CTPD),这是首个用于在具有异构分词器的模型之间迁移人类对齐行为的统一框架。CTPD 引入了三项关键创新:(1)对齐跨度投影,将教师和学生的 token 映射到共享的字符级跨度,以实现精确的监督迁移;(2)跨分词器适配的 Token 级重要性采样(TIS-DPO),以改进信用分配;(3)教师锚定参考,允许学生在 DPO 风格的目标中直接利用教师的偏好。我们的理论分析将 CTPD 建立在重要性采样的基础上,跨多个基准的实验证实了其有效性,相比现有方法取得了显著的性能提升。这些结果确立了 CTPD 作为一种实用且通用的解决方案,用于跨不同分词器方案进行偏好蒸馏,为更易访问和高效的语言模型对齐打开了大门。
引用
@article{arxiv.2601.11865,
title = {CTPD: Cross Tokenizer Preference Distillation},
author = {Truong Nguyen and Phi Van Dat and Ngan Nguyen and Linh Ngo Van and Trung Le and Thanh Hong Nguyen},
journal= {arXiv preprint arXiv:2601.11865},
year = {2026}
}
备注
AAAI 2026