大规模预训练是否是良好域间泛化的秘密?
计算机视觉与模式识别
2025-04-23 v3 机器学习
摘要
多源域间泛化 (DG) 是指在多个源域上进行训练,并在未见目标域上实现高分类性能的任务。最近的一些方法将来自 web 规模预训练 backbone 的鲁棒特征与从源数据中学习的新特征相结合,显著提升了基准结果。然而,人们仍不清楚 DG 微调方法是否正在变得更好,抑或改进的基准性能仅是更强预训练的副产品。先前的研究表明,感知相似性与零样本性能相关,但我们在 DG 场景中发现该效应有限。相反,我们认为,感知上相似的预训练数据本身并不足以;关键在于这些数据学习得如何好。这导致我们提出 Alignment Hypothesis,即最终 DG 性能高低取决于图像与类别标签文本嵌入对齐程度是否高。我们的实验确认 Alignment Hypothesis 成立,我们将其用作分析现有 DG 方法的工具,这些方法在 DomainBed 数据集上进行评估时,将评估数据划分为 In-pretraining (IP) 和 Out-of-pretraining (OOP)。我们表明,所有评估的 DG 方法在 DomainBed-OOP 上都表现不佳,而最新方法在 DomainBed-IP 上则表现卓越。综上所述,我们的发现凸显了需要能够超越预训练对齐的 DG 方法的需求。
引用
@article{arxiv.2412.02856,
title = {Is Large-Scale Pretraining the Secret to Good Domain Generalization?},
author = {Piotr Teterwak and Kuniaki Saito and Theodoros Tsiligkaridis and Bryan A. Plummer and Kate Saenko},
journal= {arXiv preprint arXiv:2412.02856},
year = {2025}
}
备注
Accepted at ICLR 2025