ProtoGCD:用于通用类别发现的统一且无偏原型学习
机器学习
2025-04-08 v1 人工智能
摘要
通用类别发现(GCD)是一个务实但未被充分探索的问题,需要模型通过利用来自旧类别的标记样本来自动聚类并发现新类别。挑战在于,未标记数据包含旧类和新类。早期采用参数分类器进行伪标记生成的方法会分别处理旧类和新类,从而导致二者准确率不平衡。近期采用对比学习的方法则忽略潜在的正样本且与聚类目标脱节,导致表示偏差并产生次优结果。为此,我们引入一种统一且无偏的原型学习框架,称为ProtoGCD,在其中,旧类和新类由联合原型和统一学习目标建模,从而实现旧类和新类的统一建模。具体而言,我们提出了一种双层自适应伪标记机制以缓解确认偏差,同时引入两个规则化项以协助学习更适合GCD的表示。此外,为实用考虑,我们设计了一个用于估计新类别数量的准则。进一步地,我们将ProtoGCD扩展用于检测未见离群点,实现任务级别的统一。广泛实验表明,ProtoGCD在通用和细粒度数据集上均实现了最先进的性能。代码已公开于https://github.com/mashijie1028/ProtoGCD。
引用
@article{arxiv.2504.03755,
title = {ProtoGCD: Unified and Unbiased Prototype Learning for Generalized Category Discovery},
author = {Shijie Ma and Fei Zhu and Xu-Yao Zhang and Cheng-Lin Liu},
journal= {arXiv preprint arXiv:2504.03755},
year = {2025}
}
备注
Accepted to IEEE TPAMI 2025