中文

基于文本条件的 JEPA 用于学习语义丰富的视觉表征

机器学习 2026-05-06 v1 计算机视觉与模式识别

摘要

基于图像的联合嵌入预测架构(I-JEPA) 提出了一种通过掩码特征预测实现视觉自监督学习的 promising 方法。然而,由于掩码位置固有的视觉不确定性,特征预测仍然具有挑战性,可能无法学习语义表征。本文提出文本条件 JEPA(TC-JEPA),使用图像标题来降低预测不确定性。具体而言,我们使用基于细粒度文本条件器的稀疏交叉注意力计算对预测的 patch 特征进行调制。有了这种条件化,patch 特征可以作为文本的函数而可预测,从而更具语义意义。我们展示 TC-JEPA 提升了下游性能和训练稳定性,并显示出有希望的扩展特性。TC-JEPA 还提供了一种新的视觉-语言预训练范式,仅基于特征预测, 在多样化任务上尤其是在需要细粒度视觉理解和推理的任务上均优于对比方法。

关键词

引用

@article{arxiv.2605.03245,
  title  = {Text-Conditional JEPA for Learning Semantically Rich Visual Representations},
  author = {Chen Huang and Xianhang Li and Vimal Thilak and Etai Littwin and Josh Susskind},
  journal= {arXiv preprint arXiv:2605.03245},
  year   = {2026}
}

备注

ICML 2026