探索多模态网络文档上的统一视觉中心对比替代方案
计算机视觉与模式识别
2025-10-22 v1
摘要
对比视觉语言模型(如CLIP)通过从对齐的图像-文本对中学习,已在广泛的多模态任务中展现出强大性能。然而,它们处理复杂的真实世界网络文档的能力仍然有限,特别是在文本和图像交错、松散对齐或以视觉形式嵌入的场景中。为应对这些挑战,我们提出了视觉中心对比学习(VC2L),一个使用单一视觉变换器对文本、图像及其组合进行建模的统一框架。VC2L完全在像素空间中运行,将所有输入(无论是文本、视觉还是组合输入)渲染为图像,从而消除了对OCR、文本分词或模态融合策略的需求。为捕捉多模态网络文档中复杂的跨模态关系,VC2L采用了一种片段级对比学习目标,该目标对齐连续的多模态片段,利用文档固有的连贯性,而无需显式配对的图像-文本数据。为评估该方法的有效性,我们引入了三个检索基准:AnyCIR、SeqCIR和CSR,分别用于评估跨模态检索、细粒度序列理解以及对未见数据的泛化能力。实验结果表明,VC2L在提出的基准和已建立的数据集(如M-BEIR和MTEB)上,与CLIP风格的模型相比,取得了具有竞争力或更优的性能。这些发现强调了多模态网络数据作为对比学习宝贵训练资源的潜力,并展示了统一视觉中心方法用于多模态表示学习的可扩展性。代码和模型可在 https://github.com/showlab/VC2L 获取。
引用
@article{arxiv.2510.18703,
title = {Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents},
author = {Yiqi Lin and Alex Jinpeng Wang and Linjie Li and Zhengyuan Yang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2510.18703},
year = {2025}
}
备注
Project page: this https://linyq17.github.io/VC2L/