SHED:面向域通用性的风格均同嵌入对齐
计算机视觉与模式识别
2026-05-19 v1 机器学习
摘要
域通用性旨在增强模型对未知域的鲁棒性,以应对嵌入分布的迁移。虽然大规模视觉语言模型如CLIP在域通用性方面表现出强大的泛化能力,但其直接的图像-文本嵌入对齐受制于固有的信任不平衡:图像编码了类别语义和域特定风格,而文本提示主要传递基本的类别线索。这一不平衡阻碍了在真实场景中对新域的泛化。为此,我们提出一种用于域通用性的风格均同嵌入对齐方法(SHED),这是一种新的CLIP基方法,通过对齐风格均同嵌入来替代编码器中原始表示进行对齐。在训练期间,SHED从两种来源域的图像嵌入以及从多样化提示模板中平均生成的文本嵌入中移除域特定风格质心。对于推理,鉴于缺乏目标域信息,SHED 将多样化文本域质心投影到视觉空间,并通过成员资格加权聚合预测。广泛的实验表明,SHED 在五个基准数据集上实现了最先进的性能,显著优于先前方法(例如在DomainNet上提升4.0%)。
引用
@article{arxiv.2605.16973,
title = {SHED: Style-Homogenized Embedding Alignment for Domain Generalization},
author = {Kai Gan and Tong Wei},
journal= {arXiv preprint arXiv:2605.16973},
year = {2026}
}