基于双空间加权与时间错位对齐的跨分词器知识蒸馏
计算与语言
2026-02-26 v1
摘要
知识蒸馏 (KD) 已成为压缩大型语言模型 (LLM) 的关键技术。虽然已有的跨分词器 KD 方法在显著进步,但其有效性受限于序列和词汇层面的次优对齐。为解决这些限制,我们引入双空间加权与时间错位对齐 (DWA-KD),这是一种新的跨分词器蒸馏框架,通过双空间熵基准加权和实现精确序列级对齐来增强 token 级蒸馏,同时利用词汇信息和语义信息实现精准的序列级对齐。在 token 级别,DWA-KD 将教师表示映射到学生空间,反之亦然,通过 KL 散度进行双空间 KD。该过程由双空间权重调制,对学生不确定且教师确定的 token 上进行加权,从而将学习聚焦于具有信息性的 token 而非对所有位置相等处理。在序列级别,DWA-KD 对嵌入层和最终隐藏状态层应用软动态时间错位 (Soft-DTW),实现教师和学生序列之间词汇语义和语境语义的稳健对齐。广泛的实验在多样化的 NLP 基准上表明,DWA-KD 在渲染质量、运动合理性和长期预测稳定性方面均优于最先进的 KD 基线。消融研究确认熵基准 token 加权和嵌入层以及最终隐藏状态层 Soft-DTW 对齐的互补贡献。
引用
@article{arxiv.2602.21669,
title = {DWA-KD: Dual-Space Weighting and Time-Warped Alignment for Cross-Tokenizer Knowledge Distillation},
author = {Duc Trung Vu and Pham Khanh Chi and Dat Phi Van and Linh Ngo Van and Sang Dinh and Trung Le},
journal= {arXiv preprint arXiv:2602.21669},
year = {2026}
}
备注
EACL Findings