中文

通过保护网络训练动力学实现彩票:具体票搜索

机器学习 2025-12-09 v1 人工智能 计算机视觉与模式识别 神经与进化计算

摘要

彩票假设主张,在密集、随机初始化的神经网络中存在高度稀疏的可训练子网络(“赢家”)。然而,现有获取这些彩票的 SOTA 方法(如 Lottery Ticket Rewinding, LTR)计算代价高昂,而更高效的基于显著性的 Pruning-at-Initialization (PaI) 技术则在准确率-稀疏性之间存在显著的权衡且难以通过基本 sanity check。本文认为,PaI 依赖的一阶显著性指标忽略了权重之间的相互依赖性,这在稀疏 regime 中尤为致命。为此,我们引入 Concrete Ticket Search (CTS),将子网络发现建模为整体组合优化问题。通过对离散搜索空间进行 Concrete 松弛,并引入 novel gradient balancing scheme (GRADBALANCE) 控制稀疏性,CTS 在无需精细调参的情况下高效识别高性能子网络。灵感来自近期关于彩票训练动力学的研究,我们进一步提出基于知识蒸馏的 pruning 目标家族,发现最小化稀疏网络输出与稠密网络输出之间逆 Kullback-Leibler 发散(CTS-KL)最为有效。在 various image classification 任务实验表明,CTS 生成的子网络稳健通过 sanity check,准确率可与 LTR 相当甚至更高,仅需计算量的一小部分。例如,在 CIFAR10 上使用 ResNet-20,CTS 实现 99.3% 稀疏度,74.0% 准确率,仅需 7.9 分钟;而 LTR 同等稀疏度下仅达 68.3% 准确率,耗时 95.2 分钟。CTS 的子网络在所有稀疏度下均优于基于显著性的方法,其在高度稀疏 regime 中的优势尤为显著。

关键词

引用

@article{arxiv.2512.07142,
  title  = {Winning the Lottery by Preserving Network Training Dynamics with Concrete Ticket Search},
  author = {Tanay Arora and Christof Teuscher},
  journal= {arXiv preprint arXiv:2512.07142},
  year   = {2025}
}

备注

This work plans to be submitted to the IEEE for possible publication