中文

当且如何让 CLIP 实现域泛化和组合泛化

机器学习 2025-09-15 v3 计算机视觉与模式识别

摘要

对比式视觉语言模型如CLIP的惊人泛化性能常被归因于其训练分布的多样性。然而,关键问题仍未解答:当在多样化的混合域上训练时,CLIP能否对完全未见过的域实现泛化(域泛化)?它能否对部分已见域中未见的类别实现泛化(组合泛化)?哪些因素影响这种泛化?为回答这些问题,我们在系统构建的训练分布上训练了CLIP模型,这些分布具有受控的域多样性和对象类别暴露。我们的实验表明,域多样性对于两者都至关重要,尽管当训练分布包含次优测试域的子集时,组合泛化可能远不如域泛化。通过数据中心和机制性分析,我们发现成功的泛化需要在中间层和电路中学习足够的共享表示。

关键词

引用

@article{arxiv.2502.09507,
  title  = {When and How Does CLIP Enable Domain and Compositional Generalization?},
  author = {Elias Kempf and Simon Schrodi and Max Argus and Thomas Brox},
  journal= {arXiv preprint arXiv:2502.09507},
  year   = {2025}
}

备注

ICML 2025 (Spotlight)