通过文本表示的目标语义聚类用于鲁棒的通用域适应
计算机视觉与模式识别
2025-06-05 v1
摘要
通用域适应(UniDA)致力于在域偏移和未知类别偏移下将源域知识迁移至目标域。其主要挑战在于识别公共类别样本并对其对齐。现有方法通常从无约束的连续图像表示空间获取目标域语义中心。由于域偏移和聚类数量未知,这些中心往往导致复杂且鲁棒性较差的对齐算法。本文基于视觉-语言模型,在语义有意义且离散的文本表示空间中搜索语义中心。该约束空间确保这些中心几乎不存在域偏差并具有适当的语义粒度,从而实现简单且鲁棒的适应算法。具体而言,我们提出通过文本表示的目标语义聚类(TASC),它以信息最大化为统一目标并包含两个阶段。第一阶段,在冻结编码器的情况下,采用基于贪心搜索的框架搜索一组最优文本嵌入以表示目标语义。第二阶段,固定搜索结果后,通过梯度下降对编码器进行优化,同时实现鲁棒的域对齐和私有类别聚类。此外,我们提出通用最大相似度(UniMS),一种专门用于检测UniDA中开集样本的评分函数。实验上,我们在四种类别偏移场景下评估UniDA算法的通用性。在四个基准数据集上的大量实验证明了本方法的有效性和鲁棒性,达到了最先进的性能。
引用
@article{arxiv.2506.03521,
title = {Target Semantics Clustering via Text Representations for Robust Universal Domain Adaptation},
author = {Weinan He and Zilei Wang and Yixin Zhang},
journal= {arXiv preprint arXiv:2506.03521},
year = {2025}
}
备注
Camera-ready version for AAAI 2025