CoMP:面向视觉基础模型的持续多模态预训练
计算机视觉与模式识别
2025-05-19 v2
摘要
预训练的视觉基础模型(Vision Foundation Models, VFMs)为广泛的应用提供了强大的视觉表示。本文持续地以多模态方式预训练主流VFMs,使其能够轻松处理不同尺寸的视觉输入,并产生更符合语言表示的视觉表示,无论其原始预训练过程如何。为此,我们引入CoMP——一个精心设计的多模态预训练管线。CoMP使用持续旋转位置编码(Continual Rotary Position Embedding)来适应不同分辨率的视觉输入,并通过视觉特征与文本特征之间的对齐损失实现更好的跨模态对齐。经过持续预训练后,像DINOv2、SigLIP和AIMv2这样的领先VFMs在多模态理解任务以及通用分类和分割任务上均实现了显著的改进。值得注意的是,CoMP-AIMv2在使用0.5B规模的LLM时,在ChartQA上取得了64.9的分数,同时在ImageNet-1K上保持87.3%的准确率,在ADE20K上以冻结块评估获得51.8 mIoU。
引用
@article{arxiv.2503.18931,
title = {CoMP: Continual Multimodal Pre-training for Vision Foundation Models},
author = {Yitong Chen and Lingchen Meng and Wujian Peng and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2503.18931},
year = {2025}
}
备注
Code is available in https://github.com/SliMM-X/CoMP-MM