重新思考深度聚类范式:自监督才是关键
计算机视觉与模式识别
2025-03-06 v1 人工智能
摘要
深度聚类最近的进展得益于自监督学习和伪监督学习的显著进步。然而,自监督与伪监督之间的权衡可能引发三个主要问题:联合训练导致特征随机性和特征漂移,而独立训练导致特征随机性和特征扭曲。本质上,使用伪标签会生成随机且不可靠的特征。伪监督与自监督的结合会偏移可靠的聚类导向特征。此外,从自监督转向伪监督会扭曲曲线潜在流形。本文针对特征随机性、特征漂移和特征扭曲三个局限性提出新范式,通过用第二轮自监督训练取代伪监督。该新策略使实例级自监督与邻域级自监督之间的转换更加平滑且不那么突兀。此外,它防止了由实例级自监督与聚类级伪监督之间强烈竞争导致的漂移效应。缺乏伪监督可防止生成随机特征的风险。通过这一新方法,本文提出了深度聚类范式的重新思考,称为 R-DC。我们的模型专为解决深度聚类中遇到的三个主要挑战:特征随机性、特征漂移和特征扭曲而设计。在六个数据集上的实验结果表明,双层自监督训练显著提升了性能。
引用
@article{arxiv.2503.03733,
title = {Rethinking Deep Clustering Paradigms: Self-Supervision Is All You Need},
author = {Amal Shaheena and Nairouz Mrabahb and Riadh Ksantinia and Abdulla Alqaddoumia},
journal= {arXiv preprint arXiv:2503.03733},
year = {2025}
}