理解多模态对比学习对分布偏移的鲁棒性
机器学习
2024-03-19 v2
摘要
近年来,多模态对比学习(MMCL)方法(如 CLIP)在学习对分布偏移具有鲁棒性且能泛化到新领域的表征方面取得了显著成功。尽管有这些实证成功,学习此类可泛化表征背后的机制仍未被理解。在本工作中,我们严格分析该问题,并揭示了 MMCL 鲁棒性背后的两种机制:类内对比(intra-class contrasting),使模型能够学习具有高方差的特征;以及类间特征共享(inter-class feature sharing),即一个类别中的标注细节有助于更好地学习其他类别。这两种机制防止了训练数据中过度表示的虚假特征掩盖可泛化的核心特征。这在分布偏移下产生了优越的零样本分类准确率。此外,我们从理论上证明了使用丰富文本描述对鲁棒性的益处,并探究了在文本描述中标注不同类型细节的影响。我们通过实验验证了我们的理论发现,包括一个精心设计的合成实验,以及在 MSCOCO/Conceptual Captions 上训练 CLIP 模型并在偏移的 ImageNet 上评估它们的实验。
引用
@article{arxiv.2310.04971,
title = {Understanding the Robustness of Multi-modal Contrastive Learning to Distribution Shift},
author = {Yihao Xue and Siddharth Joshi and Dang Nguyen and Baharan Mirzasoleiman},
journal= {arXiv preprint arXiv:2310.04971},
year = {2024}
}