中文

通过跨模态间隙检索的多模态无监督域泛化

计算机视觉与模式识别 2025-06-11 v3 机器学习

摘要

域泛化(DG)是一个重要问题,它在共享标签空间的假设下,利用一个或多个源域学习一个能泛化到未见测试域的模型。然而,大多数 DG 方法假设在目标标签空间中可以获取丰富的源数据,这一要求对于众多现实世界应用来说过于苛刻,因为在这些应用中获取与目标任务相同的标签空间成本极高。针对这一设定,我们解决了无监督域泛化的多模态版本(MUDG)问题,该问题在微调期间使用一个与任务无关的大型无标签源数据集。我们的框架没有明确假设源数据集和目标任务之间存在任何关系。相反,它仅依赖于源数据集可以在联合视觉-语言空间中被准确且高效检索的前提。我们在 MUDG 设定下做出了三项贡献。首先,我们在理论上表明,由于文本查询与用于粗量化的图像质心之间的距离较大,跨模态近似最近邻搜索的召回率较低。因此,我们提出了成对 k-means,这是一种简单的聚类算法,通过将质心存储在查询空间而非图像空间中来提高最近邻召回率。其次,我们提出了一种针对目标标签的自适应文本增强方案,旨在提高零样本准确率并使检索到的图像数据多样化。最后,我们提出了两个简单但有效的组件,以进一步提高下游目标准确率。我们在各自的基准上与最先进的仅名称迁移、无源 DG 和零样本(ZS)方法进行了比较,并表明在 20 个不同的数据集上准确率有一致提升。代码可用:https://github.com/Chris210634/mudg

关键词

引用

@article{arxiv.2402.04416,
  title  = {Multimodal Unsupervised Domain Generalization by Retrieving Across the Modality Gap},
  author = {Christopher Liao and Christian So and Theodoros Tsiligkaridis and Brian Kulis},
  journal= {arXiv preprint arXiv:2402.04416},
  year   = {2025}
}