中文

基于大语言模型的新类别发现:VLM-NCD

计算机视觉与模式识别 2025-12-12 v1

摘要

新类别发现旨在利用已知类别的先验知识,对未标记数据中的未知类别进行分类和发现。现有基于图像的NCD方法主要依赖视觉特征,存在特征判别性不足和数据长尾分布等局限。我们提出了LLM-NCD,一种多模态框架,通过融合视觉-文本语义和原型引导聚类来突破这一瓶颈。我们的核心创新在于联合优化已知类别的图像和文本特征,以建模聚类中心和语义原型。此外,我们提出一种双阶段发现机制,通过语义亲和阈值和自适应聚类动态分离已知或新样本。在CIFAR-100数据集上的实验表明,与当前方法相比,该方法在未知类别的准确率上可提升最高25.3%。值得注意的是,我们的方法在面对长尾分布时表现出独特的鲁棒性,这在NCD文献中首次实现。

关键词

引用

@article{arxiv.2512.10262,
  title  = {VLM-NCD:Novel Class Discovery with Vision-Based Large Language Models},
  author = {Yuetong Su and Baoguo Wei and Xinyu Wang and Xu Li and Lixin Li},
  journal= {arXiv preprint arXiv:2512.10262},
  year   = {2025}
}

备注

8 pages, 5 figures, conference