MoSE:层次自蒸馏增强早期层嵌入
最优化与控制
2025-08-28 v2 机器学习
概率论
机器学习
摘要
部署语言模型时,往往需要在准确率与性能之间的权衡之间寻求平衡,以满足延迟约束的同时保持实用性。传统的模型蒸馏虽能减小模型规模,但需要额外的训练成本。我们引入 ModularStarEncoder(MoSE),一个包含 10 亿参数的多退出编码器,用于代码检索和分类任务,采用新颖的自蒸馏机制。该方法显著增强了底层表示的质量,使不同模型部分能够灵活部署,并在性能权衡方面表现优异。我们的架构通过针对特定编码器层作为退出头,利用高层特征指导低层特征的训练,从而在最小的额外成本下提高中间表示。我们进一步通过存储库级别的上下文损失来增强 MoSE,以最大化训练上下文窗口的利用。此外,我们发布了一个通过代码翻译创建的新数据集,将文本到代码基准扩展为跨语言代码到代码配对。评估结果表明,自蒸馏作为一种原则方法,在各种代码理解任务中有效地在推理成本与准确率之间进行权衡。
引用
@article{arxiv.2503.03007,
title = {Benchmarking Diffusion Annealing-Based Bayesian Inverse Problem Solvers},
author = {Evan Scope Crafts and Umberto Villa},
journal= {arXiv preprint arXiv:2503.03007},
year = {2025}
}