基于联合嵌入预测的非对比学习视觉语言学习
计算机视觉与模式识别
2026-02-12 v2 人工智能
摘要
视觉语言模型已通过对比学习方法(如 CLIP)变革了多模态表征学习,但这些主导性方法需要大批量大小、谨慎的负采样和 extensive 的超参数调优。我们提出 NOVA,即 NOn-contrastive Vision-language Alignment 框架,基于联合嵌入预测和分布正则化。NOVA 通过预测增强图像视图的文本嵌入来对齐视觉表征,同时通过 Sketched Isotropic Gaussian Regularization(SIGReg)强制执行各向同性高斯结构,从而消除负采样、动量编码器和停止梯度的需求,将训练目标简化为仅一个超参数。我们使用 ClinicalBERT 作为文本编码器,对在 MIMIC-CXR 上从零开始训练的视觉 Transformer 进行评估。在三个基准数据集上的零样态胸片 X 光分类任务中,NOVA 在多个标准基线之上表现更佳,同时 exhibiting 显著更一致的训练结果。我们的结果表明,非对比学习视觉语言预训练提供了一种更简单、更稳定且更有效的替代方案。
引用
@article{arxiv.2602.00653,
title = {Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment},
author = {Lukas Kuhn and Giuseppe Serra and Florian Buettner},
journal= {arXiv preprint arXiv:2602.00653},
year = {2026}
}