中文

正则化对谱聚类的影响

机器学习 2014-07-22 v2

摘要

正如 Amini 等人 (2012) 实证演示的那样,正则化可以显著改善谱聚类的性能。在此,我们尝试通过理论分析来量化这种改进。在随机块模型 (SBM) 及其扩展下,以往关于谱聚类的结果依赖于图的最小度足够大以保证其良好性能。通过考察正则化参数 τ\tau 较大的情形,我们表明最小度假设 potentially 可以被移除。作为一种特殊情况,对于具有两个块的 SBM,结果要求最大度较大(增长速度快于 logn\log n),而非最小度。更重要的是,我们展示了正则化在并非所有节点都属于定义明确的簇的情形下的有用性。我们的结果依赖于一种类似“偏差 - 方差”的权衡,这种权衡源于对样本拉普拉斯矩阵的集中性以及特征间隙作为正则化参数函数的理解。作为我们界限的副产品,我们提出了一种数据驱动的技术 \textit{DKest}(代表估计的 Davis-Kahan 界限)用于选择正则化参数。模拟实验和真实数据集均表明该技术效果良好。

关键词

引用

@article{arxiv.1312.1733,
  title  = {Impact of regularization on Spectral Clustering},
  author = {Antony Joseph and Bin Yu},
  journal= {arXiv preprint arXiv:1312.1733},
  year   = {2014}
}

备注

37 pages