中文

从视觉到视觉-语言模型:面向域迁移的通用类别发现

计算机视觉与模式识别 2026-05-05 v1 人工智能 机器学习

摘要

通用类别发现(GCD)旨在通过从已知类别的标记数据迁移知识,将未标记的实例分为已知和未知类别。现有方法假设所有数据来自单个领域,但现实中的未标记数据常常伴随语义迁移同时也出现领域迁移。我们研究 GCD 在域迁移下的情形,提出了三种框架通过适配基础模型,从自监督视觉模型到视觉-语言模型。(i)HiLo 通过多级特征提取和相互信息最小化来解耦域特征和语义特征,结合 PatchMix 数据增强和课程采样。(ii)HLPrompt 在 HiLo 基础上引入语义感知的空间提示调谐,以抑制背景和域噪声。(iii)VLPrompt 利用视觉-语言模型通过因式化文本提示和跨模态一致性正则化。这三种方法共享核心设计原则,同时在不同的基础主干网络上运行,适用于不同的部署场景。大量实验在人工噪声和真实世界多域迁移上表明均显著优于强基线。项目页面:https://visual-ai.github.io/hilo/

关键词

引用

@article{arxiv.2605.00906,
  title  = {Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models},
  author = {Hongjun Wang and Po Hu and Kai Han},
  journal= {arXiv preprint arXiv:2605.00906},
  year   = {2026}
}

备注

Submission to TPAMI