中文

表示学习中信息瓶颈的相变

机器学习 2020-01-08 v1 信息论 math.IT 机器学习

摘要

在信息瓶颈(IB)中,当调节压缩项与预测项之间的相对强度时,这两项如何表现,它们与数据集及所学表示的关系是什么?在本文中,我们通过研究 IB 目标函数中的多个相变来回答这些问题:定义在编码分布 p(z|x) 上的 IBβ[p(zx)]=I(X;Z)βI(Y;Z)\text{IB}_\beta[p(z|x)] = I(X; Z) - \beta I(Y; Z),其中输入为 XX,目标为 YY,表示为 ZZ;观察到随着 β\beta 增大,dI(Y;Z)/dβdI(Y; Z)/d \beta 与预测精度出现突变跳跃。我们引入 IB 相变的定义,即 IB 损失景观的定性变化,并表明这些相变对应于学习新类别的开始。利用二阶变分法,我们推导出一个为 IB 相变提供实用条件的公式,并揭示其与参数化模型的 Fisher 信息矩阵的联系。我们提供两种视角来理解该公式,揭示每个 IB 相变都是在已学表示正交方向上寻找 XXYY 之间最大(非线性)相关成分,这与线性设定下的典型相关分析(CCA)极为相似。基于该理论,我们提出一种发现相变点的算法。最后,我们验证了理论和算法能准确预测类别数据集中的相变、预测 MNIST 中学习新类别的开始及类别难度,并预测 CIFAR10 中的显著相变。

关键词

引用

@article{arxiv.2001.01878,
  title  = {Phase Transitions for the Information Bottleneck in Representation Learning},
  author = {Tailin Wu and Ian Fischer},
  journal= {arXiv preprint arXiv:2001.01878},
  year   = {2020}
}

备注

ICLR 2020; 27 pages, 7 figures