从信息论视角理解模型压缩对总体风险的改善
机器学习
2019-01-29 v1 信息论
机器学习
math.IT
摘要
我们通过研究模型压缩带来的泛化误差下降与经验风险上升之间的权衡,表明模型压缩能够改善预训练模型的总体风险。我们首先证明模型压缩降低了泛化误差的一个信息论上界;这允许将模型压缩解释为避免过度拟合的正则化技术。随后,我们利用率失真理论刻画了模型压缩带来的经验风险上升。这些结果表明,若泛化误差的下降超过经验风险的上升,则总体风险可通过模型压缩得到改善。我们通过一个线性回归例子表明,这种由模型压缩导致的总体风险下降确实是可能的。我们的理论结果进一步表明,Hessian 加权的 -means 聚类压缩方法可通过正则化聚类中心之间的距离加以改进。我们提供了神经网络上的实验以支持我们的理论断言。
引用
@article{arxiv.1901.09421,
title = {Information-Theoretic Understanding of Population Risk Improvement with Model Compression},
author = {Yuheng Bu and Weihao Gao and Shaofeng Zou and Venugopal V. Veeravalli},
journal= {arXiv preprint arXiv:1901.09421},
year = {2019}
}
备注
submitted to ICML 2019