中文

渐进式权重加载:加速初始推理并在资源受限环境中逐步提升性能

机器学习 2025-10-02 v2 人工智能

摘要

深度学习模型变得越来越大、越来越复杂,导致内存消耗和计算需求增加。因此,模型加载时间和初始推理延迟增加,这在需要频繁加载和卸载模型的移动端及延迟敏感环境中构成了重大挑战,直接影响用户体验。虽然知识蒸馏(KD)通过将大型教师模型压缩为较小的学生模型提供了一种解决方案,但这通常以降低性能为代价。为了解决这一权衡,我们提出了渐进式权重加载(PWL),这是一种新颖的技术,通过首先部署轻量级学生模型,然后用预训练的教师模型的层逐步替换其层,来实现快速初始推理。为了支持无缝的层替换,我们引入了一种训练方法,该方法不仅对齐了学生层和教师层之间的中间特征表示,还提升了学生模型的整体输出性能。我们在 VGG、ResNet 和 ViT 架构上的实验表明,使用 PWL 训练的模型保持了具竞争力的蒸馏性能,并且随着教师层的加载,准确率逐步提升——在不影响初始推理速度的情况下,达到了完整教师模型的最终准确率。这使得 PWL 特别适合于响应速度和性能都至关重要的动态、资源受限的部署环境。

关键词

引用

@article{arxiv.2509.22319,
  title  = {Progressive Weight Loading: Accelerating Initial Inference and Gradually Boosting Performance on Resource-Constrained Environments},
  author = {Hyunwoo Kim and Junha Lee and Mincheol Choi and Jeonghwan Lee and Jaeshin Cho},
  journal= {arXiv preprint arXiv:2509.22319},
  year   = {2025}
}