中文

可解释无标签自引导子空间聚类

机器学习 2024-11-27 v1 计算机视觉与模式识别

摘要

大多数子空间聚类(SC)算法依赖一个或多个需要精细调谐的超参数才能实现高性能的超参数。超参数优化(HPO)通常采用网格搜索,假设存在标记数据。在某些领域,如医疗领域,这一假设在许多情况下并不成立。一个研究方向是开发无需超参数的 SC 方法。对于需要超参数的 SC 方法,一种基于内部聚类质量指标(如可用)进行无标签 HPO 调谐的思路是理想的,其性能理想情况下应与外部(标记依赖)聚类质量指标相当。在本文中,我们提出了一种基于聚类质量指标(如准确率(ACC)或归一化互信息(NMI))的无标签 HPO 方法,这些指标是通过从 SC 算法在预定义超参数网格上获得的伪标签计算得出的。假设 ACC(或 NMI)是超参数值的平滑函数,可以选择超参数值的子区间。然后,这些子区间被进一步迭代分割为一半或三分之一,直到满足相对误差准则。原则上,可以使用所提方法调整任何 SC 算法的超参数。我们在多个单视图和多视图 SC 算法上演示了这一方法,比较其在代表数字、人脸和物体的六个数据集上的 achieved performance 与其 oracle 版本。结果表明,该方法通常实现的聚类性能比 oracle 版本低 5% 至 7%。我们还通过可视化子空间基(来自计算的聚类分区估计)使该方法具有可解释性。这有助于初始选择超参数搜索空间。

关键词

引用

@article{arxiv.2411.17291,
  title  = {Interpretable label-free self-guided subspace clustering},
  author = {Ivica Kopriva},
  journal= {arXiv preprint arXiv:2411.17291},
  year   = {2024}
}

备注

45 pages; 3 figures; 10 tables