中文

SRA:用于大语言模型蒸馏的跨片段表示对齐

计算与语言 2026-05-05 v1

摘要

跨分词器知识蒸馏(CTKD)使大语言模型与较小的学生模型之间进行知识传输,即使它们采用不同的分词器。虽然现有方法主要关注分词器级别的对齐策略,但这些策略往往脆弱且对分词器之间的差异敏感。我们认为,在蒸馏之前将分词聚合成更稳健的表示的方法与对齐本身同样重要。本文引入了\textbf{SRA}(\textbf{S}pan \textbf{R}epresentation \textbf{A}lignment for Large Language Model Distillation),一个通过多粒子动力系统的物理视角重新框定CTKD的新框架。SRA将对齐的基本单位从分词转向稳健且与分词器无关的跨片段表示。我们将每个跨片段建模为一群粒子,并通过其质心(CoM)——一种注意力加权平均值——来表示其状态,这种方法捕捉了丰富的语义信息。我们利用跨片段质心的注意力加权来优先选择最重要的跨片段。此外,我们采用几何正则化来保持表示空间的结构完整性,并引入对齐跨模型跨片段逻辑蒸馏以增强知识传递。在具有挑战性的跨架构蒸馏实验中,SRA consistently and significantly outperforms state-of-the-art CTKD baselines,验证了我们基于物理的框架方法。

关键词

引用

@article{arxiv.2605.01205,
  title  = {SRA: Span Representation Alignment for Large Language Model Distillation},
  author = {Quoc Phong Dao and Hoang Son Nguyen and Pham Khanh Chi and Tung Nguyen and Linh Ngo Van and Nguyen Thi Ngoc Diep and Trung Le},
  journal= {arXiv preprint arXiv:2605.01205},
  year   = {2026}
}

备注

ACL 2026