中文

CLIP-Mamba:基于CLIP预训练的Mamba模型及其在OOD和Hessian评估中的表现

计算机视觉与模式识别 2024-05-01 v1

摘要

状态空间模型和Mamba-based模型正在越来越多地被应用于各个领域,取得了最先进的性能。本技术报告介绍了首次尝试利用对比语言-图像预训练(CLIP)训练可迁移的Mamba模型。我们训练了不同规模的Mamba模型,并对这些模型在26个零样本分类数据集和16个分布外(OOD)数据集上进行了全面评估。我们的发现表明,参数量为6700万的Mamba模型在零样本分类任务中与3.07亿参数的Vision Transformer(ViT)模型持平,凸显了Mamba模型的参数效率。 在OOD泛化测试中,Mamba-based模型在ODD图像对比度或施加高通滤波的情况下表现出卓越的性能。然而,Hessian分析表明,Mamba模型的损失 landscape 比ViT-based模型更陡峭且更非凸,这使得其更难训练。源代码可在https://github.com/raytrun/mamba-clip获取。

关键词

引用

@article{arxiv.2404.19394,
  title  = {CLIP-Mamba: CLIP Pretrained Mamba Models with OOD and Hessian Evaluation},
  author = {Weiquan Huang and Yifei Shen and Yifan Yang},
  journal= {arXiv preprint arXiv:2404.19394},
  year   = {2024}
}