中文

信息瓶颈与几何聚类

机器学习 2020-06-02 v2 人工智能 信息论 机器学习 math.IT

摘要

聚类的信息瓶颈(IB)方法取联合分布P ⁣(X,Y)P\!\left(X,Y\right)并将数据XX映射到保留关于YY最大信息的聚类标签TT(Tishby等,1999)。该目标产生一种基于条件分布P ⁣(YX)P\!\left(Y\mid X\right)相似性聚类数据点的算法。这与经典“几何聚类”算法(如kk-means与高斯混合模型(GMMs))形成对比,后者取一组观测数据点{xi}i=1:N\left\{ \mathbf{x}_{i}\right\} _{i=1:N}并基于彼此几何(通常为欧氏)距离聚类。此处,我们展示如何利用确定性信息瓶颈(DIB)(Strouse和Schwab,2017)——IB的一种变体——通过选择保留关于平滑数据集上数据点位置信息的聚类标签来执行几何聚类。我们还引入一种基于识别所用聚类数与保留空间信息间权衡最强的解来选择聚类数的新方法。我们将该方法应用于多种简单聚类问题,表明带有我们模型选择程序的DIB可恢复生成式聚类标签。我们还展示,在我们模型参数的特定极限下,用DIB与IB聚类分别等价于带硬指派与软指派的kk-means与GMM的EM拟合。因此,用(D)IB聚类推广了这些经典算法并为其提供了信息论视角。

关键词

引用

@article{arxiv.1712.09657,
  title  = {The information bottleneck and geometric clustering},
  author = {DJ Strouse and David J Schwab},
  journal= {arXiv preprint arXiv:1712.09657},
  year   = {2020}
}

备注

Updated to final published version with more detailed relationship to GMMs/k-means