中文

重新嵌入数据以增强聚类的恢复保证

机器学习 2023-01-27 v1 最优化与控制 机器学习

摘要

我们提出一种聚类方法,将四种已知技术串联为一个流水线,由此产生的算法比其中任一单独组件具有更强的恢复保证。给定Rd\mathbb R^d中的nn个点,我们流水线中的第一个组件称为蛙跳距离(leapfrog distances),类似于基于密度的聚类,产生一个n×nn\times n的距离矩阵。随后使用多维缩放和谱方法(另两种已知技术)将蛙跳距离转换为新的嵌入,得到nn个点在Rd\mathbb R^{d'}中的新嵌入,其中通常满足ddd'\ll d。最后,对重新嵌入的点应用和范数(SON)聚类。尽管第四步(SON聚类)原则上可被任何其他聚类方法替代,我们的重点在于对底层结构恢复的可证明保证。因此,我们确立重新嵌入改善了SON聚类的恢复,因为SON聚类是一种已有充分研究且具备可证明保证的方法。

关键词

引用

@article{arxiv.2301.10901,
  title  = {Re-embedding data to strengthen recovery guarantees of clustering},
  author = {Tao Jiang and Samuel Tan and Stephen Vavasis},
  journal= {arXiv preprint arXiv:2301.10901},
  year   = {2023}
}