中文

Le MuMo JEPA:基于可学习融合标记的多模态自监督表征学习

计算机视觉与模式识别 2026-04-02 v2

摘要

自监督学习已成为无需人工标注即可学习视觉表征的强大范式,但大多数方法仍单模态运行,无法捕获来自异构传感器的互补结构。我们提出 Le MuMo JEPA,一个学习自统一表征的自监督框架,支持 RGB 图像与对齐伴随模态。实验中,第二模态为相机对齐的激光雷达深度;我们也评估了 RGB-热成像训练及其在 Teledyne FLIR ADAS 数据集上的迁移。我们的做法将 LeJEPA 扩展至多模态设置,通过学习融合标记作为模态特定 patch 干枢内的潜在瓶颈。默认模型采用修剪式融合策略:初始跨模态注意力层后,模态特定标记被丢弃,迫使跨模态信息进入共享融合标记网格,随后在联合多模态 CLS 嵌入上应用 Sketched Isotropic Gaussian Regularization (SIGReg)。在 Waymo 数据集上,Le MuMo JEPA 在从零训练的多模态基线中实现了最佳性能-效率权衡,在下游 patch probes 中提升 CenterNet 检测和稠密深度,同时在分割任务中保持竞争力。在 nuScenes 上从零训练,Le MuMo JEPA 仍为最强模型,并在 FLIR 结果中取得最佳表现,尤其在 Waymo 初始化微调后。该方法在计算、内存和估计训练时间方面均显著降低,同时保持最佳整体精度-效率平衡。

关键词

引用

@article{arxiv.2603.24327,
  title  = {Le MuMo JEPA: Multi-Modal Self-Supervised Representation Learning with Learnable Fusion Tokens},
  author = {Ciem Cornelissen and Sam Leroux and Pieter Simoens},
  journal= {arXiv preprint arXiv:2603.24327},
  year   = {2026}
}

备注

14 pages, 4 figures, supplementary material. Accepted at the CVPR 2026 Workshop on Unified Robotic Vision with Cross-Modal Sensing and Alignment (URVIS)