中文

SPTNet:一种基于空间提示调优的广义类别发现高效替代框架

计算机视觉与模式识别 2025-03-20 v3 人工智能

摘要

广义类别发现(GCD)旨在通过从一组已标记的“已知”类别图像中迁移知识,对来自“已知”和“未知”类别的未标记图像进行分类。现有GCD方法的一个关键主题是调整大规模预训练模型以适应GCD任务。然而,另一种视角是调整数据表示本身,以更好地与预训练模型对齐。因此,在本文中,我们引入了一种称为SPTNet的两阶段自适应方法,该方法迭代地优化模型参数(即模型微调)和数据参数(即提示学习)。此外,我们提出了一种新颖的空间提示调优方法(SPT),该方法考虑了图像数据的空间属性,使方法能够更好地关注物体部件,这些部件可以在已知和未知类别之间迁移。我们在标准基准上对SPTNet进行了全面评估,并证明我们的方法优于现有的GCD方法。值得注意的是,我们发现我们的方法在SSB上达到了61.4%的平均准确率,比先前最先进的方法高出约10%。这一改进尤其显著,因为我们的方法产生的额外参数量仅为主干架构参数量的0.117%。项目页面:https://visual-ai.github.io/sptnet。

关键词

引用

@article{arxiv.2403.13684,
  title  = {SPTNet: An Efficient Alternative Framework for Generalized Category Discovery with Spatial Prompt Tuning},
  author = {Hongjun Wang and Sagar Vaze and Kai Han},
  journal= {arXiv preprint arXiv:2403.13684},
  year   = {2025}
}

备注

v3: Fix bold typos in table 2 and 3; v2: Update DINOv2 results; Accepted as a conference paper at ICLR 2024; Project page: https://visual-ai.github.io/sptnet