中文

M3-JEPA:基于联合嵌入预测架构的多门混合专家多模态对齐

机器学习 2025-06-19 v6 人工智能

摘要

当前的多模态学习策略主要在原始词元空间进行优化。这种框架易于与预训练语言模型的主干结合,但可能导致模态坍缩。为缓解此类问题,我们在多模态任务中利用联合嵌入预测架构(JEPA),通过一个预测器将输入嵌入转换到输出嵌入空间,然后在潜在空间进行跨模态对齐。我们通过多门混合专家(MMoE)实现该预测器,并将此框架命名为 M3-JEPA。门控函数解耦了模态特定信息和共享信息,并推导出信息论最优性。该框架同时使用对比损失和正则化损失实现,并通过不同多模态任务间的交替梯度下降(AGD)求解。通过精心设计的实验,我们表明 M3-JEPA 在不同模态和任务上均能达到最先进的性能,能泛化到未见过的数据集和领域,且在训练和推理中计算高效。我们的观察表明,M3-JEPA 可能成为开放世界中自监督学习的新基础。

关键词

引用

@article{arxiv.2409.05929,
  title  = {M3-JEPA: Multimodal Alignment via Multi-gate MoE based on the Joint-Embedding Predictive Architecture},
  author = {Hongyang Lei and Xiaolong Cheng and Qi Qin and Dan Wang and Kun Fan and Huazhen Huang and Qingqing Gu and Yetao Wu and Zhonglin Jiang and Yong Chen and Luo Ji},
  journal= {arXiv preprint arXiv:2409.05929},
  year   = {2025}
}

备注

16 pages, 5 figures. ICML 2025