表示学习中信息瓶颈的相变
机器学习
2020-01-08 v1 信息论
math.IT
机器学习
摘要
在信息瓶颈(IB)中,当调节压缩项与预测项之间的相对强度时,这两项如何表现,它们与数据集及所学表示的关系是什么?在本文中,我们通过研究 IB 目标函数中的多个相变来回答这些问题:定义在编码分布 p(z|x) 上的 ,其中输入为 ,目标为 ,表示为 ;观察到随着 增大, 与预测精度出现突变跳跃。我们引入 IB 相变的定义,即 IB 损失景观的定性变化,并表明这些相变对应于学习新类别的开始。利用二阶变分法,我们推导出一个为 IB 相变提供实用条件的公式,并揭示其与参数化模型的 Fisher 信息矩阵的联系。我们提供两种视角来理解该公式,揭示每个 IB 相变都是在已学表示正交方向上寻找 与 之间最大(非线性)相关成分,这与线性设定下的典型相关分析(CCA)极为相似。基于该理论,我们提出一种发现相变点的算法。最后,我们验证了理论和算法能准确预测类别数据集中的相变、预测 MNIST 中学习新类别的开始及类别难度,并预测 CIFAR10 中的显著相变。
引用
@article{arxiv.2001.01878,
title = {Phase Transitions for the Information Bottleneck in Representation Learning},
author = {Tailin Wu and Ian Fischer},
journal= {arXiv preprint arXiv:2001.01878},
year = {2020}
}
备注
ICLR 2020; 27 pages, 7 figures