中文

监督知识可能损害新类别发现性能

机器学习 2023-06-07 v1 计算机视觉与模式识别

摘要

新类别发现(NCD)旨在利用由不相交但相关类别组成的标注集的先验知识,推断未标注数据集中的新类别。鉴于现有文献大多主要在方法层面关注利用标注集的监督知识,本文探讨如下问题:在不同语义相关程度下,监督知识是否总是有益的?为此,我们首先建立一种称为迁移流(transfer flow)的新度量,用于衡量标注/未标注数据集之间的语义相似度。为验证所提度量的有效性,我们利用 ImageNet 的层次化类别结构,构建了一个标注/未标注数据集间具有不同语义相似度的大规模基准。基于该基准的结果表明,所提迁移流与层次化类别结构一致;且 NCD 性能与语义相似度(由所提度量衡量)一致。接着,利用所提迁移流,我们在不同语义相似度水平下进行了多项实证实验,得出监督知识可能损害 NCD 性能的结论。具体而言,与使用纯自监督知识相比,使用来自低相似度标注集的监督信息可能导致次优结果。这些结果揭示了现有 NCD 文献的不足,其通常假设监督知识是有益的。最后,我们开发了迁移流的伪版本作为实用参考,以决定 NCD 中是否应使用监督知识。其实证研究支持了有效性,表明伪迁移流(无论是否使用监督知识)与基于多个数据集的相应准确率一致。代码发布于 https://github.com/J-L-O/SK-Hurt-NCD

关键词

引用

@article{arxiv.2306.03648,
  title  = {Supervised Knowledge May Hurt Novel Class Discovery Performance},
  author = {Ziyun Li and Jona Otholt and Ben Dai and Di Hu and Christoph Meinel and Haojin Yang},
  journal= {arXiv preprint arXiv:2306.03648},
  year   = {2023}
}

备注

TMLR 2023 accepted paper. arXiv admin note: substantial text overlap with arXiv:2209.09120