基于信息瓶颈原理的神经网络分类表示学习
机器学习
2020-08-10 v6 计算机视觉与模式识别
信息论
math.IT
摘要
在这篇理论文章中,我们研究通过最小化信息瓶颈(IB)泛函来训练深度神经网络(DNNs)用于分类。我们表明由此产生的优化问题存在两个严重问题:第一,对于确定性 DNN,IB 泛函几乎对所有网络参数取值均为无穷,使优化问题不适定,或者它是分段常数,从而不接受基于梯度的优化方法。第二,IB 泛函在双射下的不变性使其无法捕捉分类所期望的所学表示的性质,如鲁棒性与简洁性。我们主张这些问题对于随机 DNN、包含(硬或软)决策规则的 DNN,或通过用相关但性质更好的代价函数替换 IB 泛函可部分解决。我们得出结论,近期报道的利用 IB 框架训练 DNN 的成功必归因于此类解决方案。作为副作用,我们的结果指出了 IB 框架用于 DNN 分析的局限性。我们还注意到,与其试图修补 IB 泛函中的固有缺陷,更好的方法可能是直接在隐表示上设计强制所需性质的正则化器。
引用
@article{arxiv.1802.09766,
title = {Learning Representations for Neural Network-Based Classification Using the Information Bottleneck Principle},
author = {Rana Ali Amjad and Bernhard C. Geiger},
journal= {arXiv preprint arXiv:1802.09766},
year = {2020}
}
备注
16 pages, to appear in IEEE Trans. Pattern Analysis and Machine Intelligence