中文

基于有损压缩的深度神经网络信息瓶颈分析

机器学习 2024-05-10 v2 信息论 math.IT

摘要

信息瓶颈 (IB) 原理提供了一个信息论框架,用于分析深度神经网络 (DNN) 的训练过程。其本质在于跟踪两个互信息 (MI) 值的动态:隐藏层输出与 DNN 输入/目标之间的互信息。根据 Shwartz-Ziv & Tishby (2017) 提出的假设,训练过程由两个不同的阶段组成:拟合与压缩。后一阶段被认为解释了 DNN 所展现的良好泛化性能。由于估计高维随机向量之间 MI 的困难性,该假设仅在微小规模或特定类型(如量化 NN)的 NN 上得到部分验证。本文中,我们引入了一个用于对一般 NN 进行 IB 分析的框架。我们的方法利用了 Goldfeld 等人 (2019) 提出的随机 NN 方法,并引入一个压缩步骤以克服与高维性相关的障碍。换言之,我们估计高维随机向量的压缩表示之间的 MI。所提方法得到理论和实际依据的支持。值得注意的是,我们通过具有预定义 MI 值的合成实验以及与 MINE (Belghazi et al., 2018) 的比较,证明了我们估计器的准确性。最后,我们在一个接近真实规模的卷积 DNN 上进行了 IB 分析,揭示了 MI 动态的新特征。

关键词

引用

@article{arxiv.2305.08013,
  title  = {Information Bottleneck Analysis of Deep Neural Networks via Lossy Compression},
  author = {Ivan Butakov and Alexander Tolmachev and Sofia Malanchuk and Anna Neopryatnaya and Alexey Frolov and Kirill Andreev},
  journal= {arXiv preprint arXiv:2305.08013},
  year   = {2024}
}

备注

23 pages, 6 figures, 4 tables