AlphaNet:利用 Alpha 散度改进超网训练
计算机视觉与模式识别
2021-06-11 v2 人工智能
机器学习
摘要
权重共享神经架构搜索(NAS)是一种用于自动化高效神经架构设计的有效技术。权重共享 NAS 构建一个超网,将所有架构作为其子网组装,并联合训练超网与子网。权重共享 NAS 的成功严重依赖于将超网知识蒸馏到子网。然而,我们发现广泛使用的蒸馏散度即 KL 散度,可能导致学生子网过高或过低估计教师超网的不确定性,致使子网性能不佳。本工作中,我们提出利用更广义的 alpha 散度改进超网训练。通过自适应选择 alpha 散度,我们同时防止对教师模型不确定性的过高或过低估计。我们将提出的基于 alpha 散度的超网训练应用于可瘦身神经网络与权重共享 NAS,并展示了显著改进。具体而言,我们发现的模型族 AlphaNet 在广泛 FLOPs 区间上优于先前最优模型,包括 BigNAS、Once-for-All 网络与 AttentiveNAS。我们以仅 444M FLOPs 实现了 ImageNet top-1 准确率 80.0%。我们的代码与预训练模型见于 https://github.com/facebookresearch/AlphaNet。
引用
@article{arxiv.2102.07954,
title = {AlphaNet: Improved Training of Supernets with Alpha-Divergence},
author = {Dilin Wang and Chengyue Gong and Meng Li and Qiang Liu and Vikas Chandra},
journal= {arXiv preprint arXiv:2102.07954},
year = {2021}
}
备注
International Conference on Machine Learning (ICML) 2021