中文

利用表征学习进行判别聚类的任意标注与未标注数据比例方法

机器学习 2023-02-21 v2 机器学习

摘要

我们提出了一种判别聚类方法,其中特征表征可从数据中学习,并可进一步利用标注数据。表征学习能使基于相似性的聚类方法自动适应数据底层而隐藏的几何结构。所提方法为 DIFFRAC 方法增添了表征学习能力,使用基于梯度的随机训练算法和带熵正则的最优传输算法来执行聚类分配步骤。该方法在多个真实数据集上评估,改变标注数据与未标注数据的比例,从而在完全无监督 regime 与完全有监督 regime 之间插值。实验结果表明,所提方法即使在完全无监督 regime 下也能学习强大的特征表征,并能利用甚至少量的标注数据改进特征表征并获得复杂数据集的更好聚类。

关键词

引用

@article{arxiv.1912.12979,
  title  = {Discriminative Clustering with Representation Learning with any Ratio of Labeled to Unlabeled Data},
  author = {Corinne Jones and Vincent Roulet and Zaid Harchaoui},
  journal= {arXiv preprint arXiv:1912.12979},
  year   = {2023}
}

备注

Published in Statistics and Computing, 2022