相似性与聚类的孪生学习:一种统一的核方法
机器学习
2017-05-04 v2 计算机视觉与模式识别
机器学习
摘要
许多基于相似性的聚类方法分两个独立步骤进行,包括相似性矩阵计算和随后的谱聚类。然而,相似性度量具有挑战性,因为它通常受诸多因素影响,例如相似性度量的选择、邻域大小、数据规模、噪声与离群点。因此学习到的相似性矩阵往往不适合后续聚类,更遑论最优。此外,许多真实世界数据中存在非线性相似性,但现有大多数方法未能有效考虑。为应对这两大挑战,我们提出一种在核空间中以原则性方式同时学习聚类指示矩阵与相似性信息的模型。我们展示了其与核 k-means、k-means 和谱聚类方法的理论关联。进而,为解决如何为特定聚类任务选择最合适核的实际问题,我们进一步以多核学习能力扩展该模型。借助此联合模型,我们能自动完成三个子任务:寻找最佳聚类指示矩阵、最准确相似性关系以及多核的最优组合。通过在联合框架中利用这三个子任务间的相互作用,每个子任务均可利用其他子任务的结果迭代提升,趋向全局最优解。我们进行了大量实验以证明方法的有效性。
引用
@article{arxiv.1705.00678,
title = {Twin Learning for Similarity and Clustering: A Unified Kernel Approach},
author = {Zhao Kang and Chong Peng and Qiang Cheng},
journal= {arXiv preprint arXiv:1705.00678},
year = {2017}
}
备注
Published in AAAI 2017