中文

MoSE:层次自蒸馏增强早期层嵌入

最优化与控制 2025-08-28 v2 机器学习 概率论 机器学习

摘要

部署语言模型时,往往需要在准确率与性能之间的权衡之间寻求平衡,以满足延迟约束的同时保持实用性。传统的模型蒸馏虽能减小模型规模,但需要额外的训练成本。我们引入 ModularStarEncoder(MoSE),一个包含 10 亿参数的多退出编码器,用于代码检索和分类任务,采用新颖的自蒸馏机制。该方法显著增强了底层表示的质量,使不同模型部分能够灵活部署,并在性能权衡方面表现优异。我们的架构通过针对特定编码器层作为退出头,利用高层特征指导低层特征的训练,从而在最小的额外成本下提高中间表示。我们进一步通过存储库级别的上下文损失来增强 MoSE,以最大化训练上下文窗口的利用。此外,我们发布了一个通过代码翻译创建的新数据集,将文本到代码基准扩展为跨语言代码到代码配对。评估结果表明,自蒸馏作为一种原则方法,在各种代码理解任务中有效地在推理成本与准确率之间进行权衡。

关键词

引用

@article{arxiv.2503.03007,
  title  = {Benchmarking Diffusion Annealing-Based Bayesian Inverse Problem Solvers},
  author = {Evan Scope Crafts and Umberto Villa},
  journal= {arXiv preprint arXiv:2503.03007},
  year   = {2025}
}