中文

回弦蒸馏实现零样模型尺寸插值

机器学习 2026-03-03 v2

摘要

大型语言模型(LLMs)通常在多样化的内存和计算约束条件下进行部署。现有方法通过独立训练每个模型尺寸来构建模型家族,这既昂贵又仅提供粗粒度的尺寸选项。本文发现了一种称为回弦蒸馏(boomerang distillation)的新现象:以大型基准模型(教师)为起点,首先蒸馏到小型学生模型,然后通过在学生模型中重新引入教师层的模块(而无需额外训练),逐步重构中间尺寸的模型。该过程生成的零样插值模型在尺寸之间表现平滑,性能常常匹配或超越相同尺寸的预训练或蒸馏模型。我们进一步分析了这种插值何时会成功,表明通过修剪和蒸馏实现的教师与学生之间的对齐是关键。回弦蒸馏为生成细粒度模型家族提供了一种简单且高效的方法,显著降低了训练成本,同时实现了跨部署环境的灵活适应。代码和模型均可在 https://github.com/dcml-lab/boomerang-distillation 提供。

关键词

引用

@article{arxiv.2510.05064,
  title  = {Boomerang Distillation Enables Zero-Shot Model Size Interpolation},
  author = {Sara Kangaslahti and Nihal V. Nayak and Jonathan Geuter and Marco Fumero and Francesco Locatello and David Alvarez-Melis},
  journal= {arXiv preprint arXiv:2510.05064},
  year   = {2026}
}

备注

ICLR 2026