中文

基于关键-查询匹配的大语言模型双空间知识蒸馏

计算与语言 2026-05-19 v2

摘要

大型语言模型(LLM)在语言任务上实现了最新进展(SOTA),但因其规模和资源需求在部署时成本较高。知识蒸馏(KD)通过训练较小的学生模型来模仿较大的教师模型,从而在不显著牺牲性能的前提下提高效率。基于关键-查询匹配的跨模型注意力(DSKD-CMA)已被证明是实现不同分词器之间 KD 的 SOTA 方法,但其内部工作机制仍鲜有探讨。本文通过手动标记对齐探针和热力图可视化系统分析了 DSKD-CMA 的注意力机制,揭示了其优势与局限。基于此,我们引入了一种新方法 DSKD-CMA-GA,基于生成对抗学习(GA),以解决来自不同模型计算的键和查询之间的分布不匹配问题。实验表明,该方法在文本生成质量上实现了持续但稳健的 ROUGE-L 提升,尤其在跨分布数据上提升约 0.37,缩小了跨分词器与同分词器 KD 之间的差距。

关键词

引用

@article{arxiv.2603.22056,
  title  = {Dual-Space Knowledge Distillation with Key-Query Matching for Large Language Models with Vocabulary Mismatch},
  author = {Stella Eva Tsiapali and Cong-Thanh Do and Kate Knill},
  journal= {arXiv preprint arXiv:2603.22056},
  year   = {2026}
}

备注

Copyright 2026 IEEE. Published in ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), scheduled for 4-8 May 2026 in Barcelona, Spain