中文

SNEkhorn:基于对称熵亲和力的降维方法

机器学习 2023-10-31 v2

摘要

机器学习中的许多方法依赖于加权图来编码数据集中样本间的相似性。熵亲和力(EAs)——尤其用于流行的降维(DR)算法t-SNE中——是此类图的特例。为确保对异构采样密度的鲁棒性,EAs为每个样本分配一个核带宽参数,使得亲和力矩阵每一行的熵保持为特定常值,该常值的指数称为困惑度(perplexity)。EAs固有地非对称且按行随机,但在DR方法中使用时需经过启发式对称化,这违背了按行恒定熵与随机性性质。本工作中,我们揭示了EA作为一种最优传输问题的新刻画,从而实现可借助对偶上升高效计算的天然对称化。相应的新型亲和力矩阵因对称双随机归一化在聚类性能上获益,同时有效调控每行熵,从而特别鲁棒于不同噪声水平。随后,我们提出一种利用该新亲和力矩阵的新DR算法SNEkhorn。我们在合成与真实数据集上通过若干指标展示了其相对于最先进方法的明显优越性。

关键词

引用

@article{arxiv.2305.13797,
  title  = {SNEkhorn: Dimension Reduction with Symmetric Entropic Affinities},
  author = {Hugues Van Assel and Titouan Vayer and Rémi Flamary and Nicolas Courty},
  journal= {arXiv preprint arXiv:2305.13797},
  year   = {2023}
}

备注

NeurIPS 2023 conference paper