揭示 CLIP 中的骨干网络效应:探索表征协同与差异
计算机视觉与模式识别
2023-12-25 v1
摘要
对比语言 - 图像预训练(CLIP)是图像表征学习中一种突出的方法。各种神经架构,从基于 Transformer 的模型(如 Vision Transformers, ViTs)到卷积网络(如 ResNets),均使用 CLIP 进行训练,并作为不同视觉任务的通用骨干网络。尽管使用相同的数据和训练目标,这些架构所学表征的有效性引发了一个关键问题。我们的研究探讨了这些骨干架构之间 CLIP 性能的差异,揭示了它们在分类任务中的显著差距。值得注意的是,对这些表征进行归一化会导致巨大的性能变化。我们的研究结果展示了骨干网络预测之间可能存在显著的协同效应,通过明智地选择合适的骨干网络,性能提升可超过 20%。此外,我们提出了一种简单而有效的方法来组合多个骨干网络的预测,从而实现了高达 6.34% 的显著性能提升。我们将发布用于复现结果的代码。
引用
@article{arxiv.2312.14400,
title = {Unveiling Backbone Effects in CLIP: Exploring Representational Synergies and Variances},
author = {Cristian Rodriguez-Opazo and Edison Marrese-Taylor and Ehsan Abbasnejad and Hamed Damirchi and Ignacio M. Jara and Felipe Bravo-Marquez and Anton van den Hengel},
journal= {arXiv preprint arXiv:2312.14400},
year = {2023}
}