中文

层次自蒸馏增强早期层嵌入:MoSE

计算与语言 2026-01-27 v3 人工智能 编程语言 软件工程

摘要

部署语言模型时,往往需要在准确率与性能之间的权衡之间寻求平衡,以满足延迟约束的同时保持实用性。传统的模型蒸馏虽能减小模型规模,但需要额外的训练成本。我们引入 ModularStarEncoder(MoSE),一个包含 10 亿参数的多退出编码器,用于代码检索和分类任务,采用新颖的自蒸馏机制。该方法显著增强了底层表示的质量,使不同模型部分能够灵活部署,并在性能权衡方面表现优异。我们的架构通过针对特定编码器层作为退出头,利用高层特征指导低层特征的训练,从而在最小的额外成本下提高中间表示。我们进一步通过存储库级别的上下文损失来增强 MoSE,以最大化训练上下文窗口的利用。此外,我们发布了一个通过代码翻译创建的新数据集,将文本到代码基准扩展为跨语言代码到代码配对。评估结果表明,自蒸馏作为一种原则方法,在各种代码理解任务中有效地在推理成本与准确率之间进行权衡。

关键词

引用

@article{arxiv.2503.03008,
  title  = {MoSE: Hierarchical Self-Distillation Enhances Early Layer Embeddings},
  author = {Andrea Gurioli and Federico Pennino and João Monteiro and Maurizio Gabbrielli},
  journal= {arXiv preprint arXiv:2503.03008},
  year   = {2026}
}

备注

Accepted in the AAAI 2026 Main Technical Track