VL-JEPA:面向视觉-语言的联合嵌入预测架构
计算机视觉与模式识别
2026-02-03 v2
摘要
我们提出了 VL-JEPA,一种基于联合嵌入预测架构(JEPA)的视觉-语言模型。与经典 VLM 中的自回归生成 token 不同,VL-JEPA 预测目标文本的连续嵌入。通过在抽象表示空间中学习,该模型聚焦于任务相关的语义,同时抽象掉表面层面的语言变异性。在与标准 token 空间 VLM 训练(使用相同视觉编码器和训练数据)的严格控制比较中,VL-JEPA 在拥有少 50% 可训练参数的情况下取得了更强的性能。在推理时,仅在需要时才调用一个轻量级文本解码器,将 VL-JEPA 预测的嵌入转换为文本。我们表明 VL-JEPA 原生支持选择性解码,将解码操作数量减少了 2.85 倍,同时保持与非自适应均匀解码相似的性能。除了生成之外,VL-JEPA 的嵌入空间自然地支持开放词汇分类、文本到视频检索和判别式 VQA,无需任何架构修改。在八个视频分类和八个视频检索数据集上,VL-JEPA 的平均性能超越了 CLIP、SigLIP2 和 Perception Encoder。同时,该模型在四个 VQA 数据集——GQA、TallyQA、POPE 和 POPEv2——上取得了与经典 VLM(InstructBLIP、QwenVL)相当的性能,尽管仅有 1.6B 参数。
引用
@article{arxiv.2512.10942,
title = {VL-JEPA: Joint Embedding Predictive Architecture for Vision-language},
author = {Delong Chen and Mustafa Shukor and Theo Moutakanni and Willy Chung and Jade Yu and Tejaswi Kasarla and Yejin Bang and Allen Bolourchi and Yann LeCun and Pascale Fung},
journal= {arXiv preprint arXiv:2512.10942},
year = {2026}
}