中文

训练与测试均无额外开销的深度集成:动态稀疏性的全方位优势

机器学习 2026-02-03 v6 计算机视觉与模式识别

摘要

深度集成在提升预测性能、不确定性估计和分布外鲁棒性方面的成功已在机器学习文献中得到广泛研究。尽管结果令人鼓舞,但朴素地训练多个深度神经网络并在推理时组合其预测会导致极高的计算成本和内存需求。近期提出的高效集成方法以显著降低的成本达到了传统深度集成的性能。然而,这些方法所需的训练资源仍至少与训练单个稠密模型相同。在本工作中,我们建立了稀疏神经网络训练与深度集成之间的独特联系,由此提出一种名为 FreeTickets 的新型高效集成学习框架。我们并非训练多个稠密网络并取平均,而是直接从零开始训练稀疏子网络,并在这一高效的稀疏到稀疏训练中萃取出多样且准确的子网络。我们的框架 FreeTickets 被定义为这些相对廉价的稀疏子网络的集成。尽管是一种集成方法,FreeTickets 的参数数量和训练 FLOPs 甚至少于单个稠密模型。这一看似反直觉的结果源于动态稀疏训练的超高训练/推理效率。FreeTickets 在以下所有指标上均超越稠密基线:预测精度、不确定性估计、分布外(OoD)鲁棒性,以及训练和推理的效率。令人印象深刻的是,FreeTickets 在 ImageNet 上以 ResNet50 超越朴素深度集成,仅使用了后者所需训练 FLOPs 约 1/5。我们已在 https://github.com/VITA-Group/FreeTickets 发布源代码。

关键词

引用

@article{arxiv.2106.14568,
  title  = {Deep Ensembling with No Overhead for either Training or Testing: The All-Round Blessings of Dynamic Sparsity},
  author = {Shiwei Liu and Tianlong Chen and Zahra Atashgahi and Xiaohan Chen and Ghada Sokar and Elena Mocanu and Mykola Pechenizkiy and Zhangyang Wang and Decebal Constantin Mocanu},
  journal= {arXiv preprint arXiv:2106.14568},
  year   = {2026}
}

备注

published in International Conference on Learning Representations (ICLR 2022)