中文

向细粒度感知的开集域泛化迈进

计算机视觉与模式识别 2025-12-15 v2 人工智能

摘要

开集域泛化(OSDG)针对的是部署模型遇到的同时存在域偏移和新颖目标类别的现实场景。尽管视觉语言模型如CLIP取得了显著进展,现有方法仍陷入已知类别结构风险与未知类别开放空间风险之间的困境,尤其在区分与已知类别在细粒度视觉相似性方面存在“硬性未知”时容易出现过度自信。为此,我们提出了语义增强CLIP(SeeCLIP)框架,通过细粒度语义增强显式解决这一困境。在SeeCLIP中,我们提出了语义感知提示增强模块,将图像分解为判别性语义标记,实现超越粗糙类别标签的细粒度视觉语言对齐。为有效定位未知提示,我们引入双向对比学习,包含两个互补目标:即排斥以维持与已知类别的可分性,和聚合以保持语义接近性。进一步,我们的语义引导扩散模块通过扰动提取的语义标记生成伪未知样本,产生与已知类别在视觉上相似但具有关键局部差异的硬负样本。这些硬负样本迫使模型学习更细致的决策边界。在五个基准测试上的大量实验表明,我们的方法在准确率和H-score上分别显著提升3%和5%。

关键词

引用

@article{arxiv.2511.16979,
  title  = {The Finer the Better: Towards Granular-aware Open-set Domain Generalization},
  author = {Yunyun Wang and Zheng Duan and Xinyue Liao and Ke-Jia Chen and Songcan Chen},
  journal= {arXiv preprint arXiv:2511.16979},
  year   = {2025}
}

备注

9 pages,3 figures,aaai2026