凸度蒸馏:通过凸优化高效压缩深度网络
机器学习
2024-10-10 v1
摘要
部署大型复杂的深度神经网络于资源受限的边缘设备面临着计算需求和非凸优化复杂性的挑战。传统压缩方法如蒸馏和剪枝往往保留非凸性,使得在此类设备上进行实时微调变得复杂。此外,这些方法通常需要在压缩后进行大量的端到端网络微调以维持模型性能,这既耗时又需要完整标注数据集,从而可能消除高效网络压缩的优势。本文引入一种新型蒸馏技术,通过凸优化高效压缩模型——消除中间非凸激活函数,并仅使用来自原始模型的中间激活。我们的做法使蒸馏在无标签数据设置下即可实现,性能可与原始模型相当,且无需后压缩微调。我们在多个标准数据集上展示了该方法对图像分类模型的有效性,并进一步表明在数据有限的情境下,该方法可超越标准非凸蒸馏方法。我们的技术为在边缘设备上部署高效、低资源占用的模型提供了显著优势,具有实际应用价值。我们展示了在提供来自大型预训练非凸模型丰富特征表示后,凸神经网络可实现性能相当于其非凸对手的水平,为未来在凸优化与深度学习交叉领域的研究开辟了新路径。
引用
@article{arxiv.2410.06567,
title = {Convex Distillation: Efficient Compression of Deep Networks via Convex Optimization},
author = {Prateek Varshney and Mert Pilanci},
journal= {arXiv preprint arXiv:2410.06567},
year = {2024}
}
备注
10 Pages, 7 figures, 2 tables