中文

RAD:通过自推测解码实现混合模型的冗余感知蒸馏

计算与语言 2025-05-29 v1 机器学习

摘要

结合Transformer和状态空间模型(SSM)的混合模型在平衡性能和效率方面极具前景。然而,优化这些混合模型,特别是解决Transformer组件内部固有的潜在冗余,仍然是一个重大挑战。在本文中,我们提出了RAD(冗余感知蒸馏),这是一个新颖的框架,它使用自推测解码作为诊断工具来识别模型中冗余的注意力层。随后,这些被识别的层被选择性地替换为SSM组件,并进行针对性的(自)蒸馏。具体而言,RAD将知识转移集中在被识别为冗余的组件上,同时考虑了架构变化和特定的权重初始化策略。我们通过实验证明,使用RAD的自蒸馏在数学和编码任务上显著超越了原始基础模型的性能。此外,RAD在标准知识蒸馏设置中也很有效,与基线方法相比实现了高达约2倍的收敛速度。值得注意的是,当使用小得多的Llama-3.1 8B作为教师模型时,RAD在GSM8K上取得了71.27分,在CRUX上取得了28.25分;而使用Llama-3.1 70B教师模型蒸馏的基线模型在GSM8K和CRUX上仅分别取得46.17和22.75分。RAD为混合模型蒸馏中的高效优化和性能提升提供了一条新途径。

关键词

引用

@article{arxiv.2505.22135,
  title  = {RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding},
  author = {Yuichiro Hoshino and Hideyuki Tachibana and Muneyoshi Inahara and Hiroto Takegawa},
  journal= {arXiv preprint arXiv:2505.22135},
  year   = {2025}
}

备注

26 pages