中文

AlphaNet:利用 Alpha 散度改进超网训练

计算机视觉与模式识别 2021-06-11 v2 人工智能 机器学习

摘要

权重共享神经架构搜索(NAS)是一种用于自动化高效神经架构设计的有效技术。权重共享 NAS 构建一个超网,将所有架构作为其子网组装,并联合训练超网与子网。权重共享 NAS 的成功严重依赖于将超网知识蒸馏到子网。然而,我们发现广泛使用的蒸馏散度即 KL 散度,可能导致学生子网过高或过低估计教师超网的不确定性,致使子网性能不佳。本工作中,我们提出利用更广义的 alpha 散度改进超网训练。通过自适应选择 alpha 散度,我们同时防止对教师模型不确定性的过高或过低估计。我们将提出的基于 alpha 散度的超网训练应用于可瘦身神经网络与权重共享 NAS,并展示了显著改进。具体而言,我们发现的模型族 AlphaNet 在广泛 FLOPs 区间上优于先前最优模型,包括 BigNAS、Once-for-All 网络与 AttentiveNAS。我们以仅 444M FLOPs 实现了 ImageNet top-1 准确率 80.0%。我们的代码与预训练模型见于 https://github.com/facebookresearch/AlphaNet。

关键词

引用

@article{arxiv.2102.07954,
  title  = {AlphaNet: Improved Training of Supernets with Alpha-Divergence},
  author = {Dilin Wang and Chengyue Gong and Meng Li and Qiang Liu and Vikas Chandra},
  journal= {arXiv preprint arXiv:2102.07954},
  year   = {2021}
}

备注

International Conference on Machine Learning (ICML) 2021