中文

Happy:面向持续广义类别发现的去偏学习框架

计算机视觉与模式识别 2024-10-11 v2

摘要

持续发现新概念是应对不断演变环境中的关键任务。本文探讨了较少被探讨的持续广义类别发现(Continual Generalized Category Discovery, C-GCD)任务,该任务旨在从无标签数据中逐步发现新类别,同时保持对以前学习类别的识别能力。虽然已提出多种设置来研究 C-GCD 任务,但这些方法都存在局限,无法反映真实世界情景。因此,我们研究了更为实际的 C-GCD 设置:随着时间推移,发现的新类别数量更多且持续时间更长,且不存储以前类别的样本。在 C-GCD 中,模型首先在已知类别的有标签数据上进行训练,随后在包含旧类别和新类别的无标签数据上进行多个增量阶段。核心挑战在于两个相互冲突的目标:发现新类别并防止遗忘旧类别。我们深入分析了这些冲突,识别出模型易受预测偏差和难度偏差的影响。为解决这些问题,我们引入了一个去偏学习框架,称为 Happy,特点是硬度感知原型采样和软熵正则化。针对预测偏差,我们首先引入基于聚类的初始化,以提供稳健的特征。此外,我们提出了软熵正则化,以为新类别分配合适的概率,从而显著提升新类别的聚类性能。针对硬度偏差,我们提出了硬度感知原型采样,该方法可有效减少以前看到的类别(尤其是难类别)的遗忘问题。实验结果表明,我们的方法在各种数据集上都能熟练地管理 C-GCD 的冲突,取得显著成绩,例如在 ImageNet-100 上实现 7.5% 的整体提升。我们的代码已公开于 https://github.com/mashijie1028/Happy-CGCD。

关键词

引用

@article{arxiv.2410.06535,
  title  = {Happy: A Debiased Learning Framework for Continual Generalized Category Discovery},
  author = {Shijie Ma and Fei Zhu and Zhun Zhong and Wenzhuo Liu and Xu-Yao Zhang and Cheng-Lin Liu},
  journal= {arXiv preprint arXiv:2410.06535},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024