野外领域泛化:无监督分类与域感知表征的解耦
计算机视觉与模式识别
2025-10-10 v2 机器学习
摘要
评估基于 CLIP 等基础模型的领域泛化 (domain generalization, DG) 具有挑战性,因为 web 规模的预训练数据可能涵盖许多现有基准。因此,当前的 DG 评估可能既不够具挑战性,也不充分测试真正未见数据情景。为更好地评估 CLIP 在野外领域泛化中的表现,我们考虑了两种方法:(1) 在在 ImageNet 上微调 CLIP 后,对 33 个多样化数据集进行评估,并量化其外分布 (out-of-distribution, OOD) 分数;(2) 使用无监督技术使 CLIP "忘记" 部分域,以此作为近似。我们观察到,随着 OOD 数据集的程度增加,CLIP 的性能显著下降。为解决此问题,我们提出了 CLIP-DCA(Disentangling Classification from enhanced domain Aware representations,即解耦分类与增强域感知表征)。我们的方法动因是:虽然标准的域不变性损失旨在使表征域不变,但这会对基础模型造成伤害,因而丢弃了有益于泛化的域感知表征。我们假设,增强域感知性是基础模型实现有效域不变分类的前提。CLIP-DCA 通过独立的域头和合成生成的多样化域数据,识别并增强 CLIP 编码器中的域感知性。同时,通过与域特征的解耦,鼓励域不变的分类。CLIP-DCA 在这一具挑战性评估中相较于现有方法展现出显著改进,尤其在更具 OOD 性质的数据集上表现更佳。
引用
@article{arxiv.2508.21769,
title = {Domain Generalization in-the-Wild: Disentangling Classification from Domain-Aware Representations},
author = {Ha Min Son and Zhe Zhao and Shahbaz Rezaei and Xin Liu},
journal= {arXiv preprint arXiv:2508.21769},
year = {2025}
}