CLIP 中的协同与多样性:通过自适应主干网络集成提升性能
计算机视觉与模式识别
2025-02-18 v2 人工智能
机器学习
摘要
对比式语言-图像预训练 (CLIP) 作为一种流行的图像表征学习方法。各种体系结构,从视觉 Transformer (ViT) 到卷积网络 (ResNet) 都已使用 CLIP 进行训练,以作为多种视觉任务的通用解决方案。本文探讨了各种 CLIP 训练的视觉主干网络之间的差异。尽管使用相同的数据和训练目标,但我们发现这些体系结构的表征差异显著,不同的数据集上的分类性能差异也较大,对某些类型图像扰动的鲁棒性也不同。我们的发现表明,通过利用各自优势的 CLIP 主干网络之间可能存在惊人的协同作用。理论上,通过对每个测试样本进行优化主干网络的选择,分类准确率可提高超过 40 个百分点。基于这一洞察,我们开发了一种简单而强大的自适应集成多个主干网络的方法。该方法仅需每个类别一个标记示例即可调整自适应组合主干网络。在大量数据集上,该方法实现了超过最佳单一主干网络 39.1% 的准确率提升,远远超出传统集成方法。
关键词
引用
@article{arxiv.2405.17139,
title = {Synergy and Diversity in CLIP: Enhancing Performance Through Adaptive Backbone Ensembling},
author = {Cristian Rodriguez-Opazo and Ehsan Abbasnejad and Damien Teney and Hamed Damirchi and Edison Marrese-Taylor and Anton van den Hengel},
journal= {arXiv preprint arXiv:2405.17139},
year = {2025}
}
备注
ICLR 2025. arXiv admin note: text overlap with arXiv:2312.14400