邻接网络:一种用于网络压缩的训练范式及其应用
机器学习
2022-04-18 v5 神经与进化计算
机器学习
摘要
在希望将大型强力模型部署于生产环境和/或边缘设备时,在保持精度的同时压缩深度神经网络十分重要。实现该目标的常用技术之一是知识蒸馏。通常,静态预定义教师(大型基网络)的输出被用作软标签来训练并向学生(或更小)网络传递信息。本文中,我们引入邻接网络(AN),一种同时训练原始基网络与较小压缩网络的学习范式。在我们的训练方法中,较小网络的参数在基网络与压缩网络间共享。借助我们的训练范式,我们可同时压缩(学生网络)与正则化(教师网络)任意架构。本文聚焦于用于计算机视觉任务的流行基于 CNN 的架构。我们在多个大规模数据集上对所提训练范式进行了广泛实验评估。以 ResNet-50 为基网络,AN 在 ImageNet 数据集上仅用 1.8M 参数与 1.6 GFLOPs 即达到 71.8% 的 top-1 精度。我们进一步提出可微邻接网络(DAN),一种通过神经架构搜索联合学习较小网络各层宽度与权重的训练范式,对 AN 进行了增强。DAN 在 ImageNet 上以少 的参数与少 的 FLOPs 达到了 ResNet-50 级别的精度。
引用
@article{arxiv.2006.05624,
title = {Adjoined Networks: A Training Paradigm with Applications to Network Compression},
author = {Utkarsh Nath and Shrinu Kushagra and Yingzhen Yang},
journal= {arXiv preprint arXiv:2006.05624},
year = {2022}
}
备注
Published at AAAI 2022 Spring Symposium on Machine Learning and Knowledge Engineering for Hybrid Intelligence Code available at: https://github.com/utkarshnath/Adjoint-Network.git