中文

TI-JEPA:面向文本图像多模态系统的创新能量基联合嵌入策略

计算机视觉与模式识别 2025-03-11 v1 计算与语言

摘要

本文聚焦于人工智能领域的多模态对齐问题,尤其是文本与图像模态之间的语义鸿沟,导致多模态融合效果受限。因此,我们引入文本图像联合嵌入预测架构(TI-JEPA),一种创新的预训练策略,利用能量基模型(EBM)框架捕捉复杂的跨模态关系。TI-JEPA结合EBM在自监督学习中的灵活性,以促进文本与视觉元素之间的兼容性。通过多个基准上的大量实验,我们展示TI-JEPA在多模态情感分析任务(以及潜在的广泛多模态任务,如视觉问答)上实现了最先进的性能,超越了现有预训练方法。我们的发现凸显了能量基框架在推动多模态融合方面的潜力,并为下游应用带来显著提升。

关键词

引用

@article{arxiv.2503.06380,
  title  = {TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems},
  author = {Khang H. N. Vo and Duc P. T. Nguyen and Thong Nguyen and Tho T. Quan},
  journal= {arXiv preprint arXiv:2503.06380},
  year   = {2025}
}