中文

判别熵聚类及其与 K-means 和 SVM 的关系

机器学习 2024-10-01 v4 计算机视觉与模式识别

摘要

最大化模型输入与输出之间的互信息与 softmax 预测的“决定性”和“公平性”形式相关,这促使了这些基于熵的无监督聚类准则的产生。首先,在线性 softmax 模型的背景下,我们讨论了基于熵的聚类的一些一般性质。我们反驳了一些早期的主张,指出了其与 K-means 的根本差异。另一方面,我们证明了决定性的间隔最大化性质,建立了其与基于 SVM 的聚类的关系。其次,我们提出了一种针对一般 softmax 模型的熵聚类新自标注公式。伪标签作为辅助变量被引入,以“拆分”公平性与决定性。推导出的自标注损失包含对伪标签错误具有鲁棒性的反向交叉熵,并允许一种高效的 EM 求解器用于伪标签。我们的算法在多个深度聚类标准基准上改进了当前最优 (SOTA) 水平。

关键词

引用

@article{arxiv.2301.11405,
  title  = {Discriminative Entropy Clustering and its Relation to K-means and SVM},
  author = {Zhongwen Zhang and Yuri Boykov},
  journal= {arXiv preprint arXiv:2301.11405},
  year   = {2024}
}

备注

Submitted to TPAMI