超越文字:多模态大语言模型的自我监督视觉学习
计算机视觉与模式识别
2025-12-19 v1 人工智能
计算与语言
多媒体
摘要
多模态大语言模型(MLLM)最近在连接视觉和语言方面展示了令人印象深刻的能力,但它们在基础视觉推理任务上的熟练程度仍然有限。这一局限性可归因于MLLM主要从文本描述中学习视觉理解,而文本描述构成了一种主观的、本质上不完整的监督信号。此外,与大规模纯文本预训练相比,多模态指令微调规模有限,导致MLLM过度拟合语言先验而忽略视觉细节。为了解决这些问题,我们引入了JARVIS,一个受JEPA启发的MLLM自我监督视觉增强框架。具体而言,我们将I-JEPA学习范式集成到MLLM训练的标准视觉-语言对齐流水线中。我们的方法利用冻结的视觉基础模型作为上下文和目标编码器,同时训练预测器(实现为LLM的早期层),使其在不依赖语言监督的情况下从图像中学习结构和语义规律。在标准MLLM基准上的广泛实验表明,JARVIS在不同LLM家族的视觉中心基准上持续提升性能,且不损害多模态推理能力。我们的源代码公开可用:https://github.com/aimagelab/JARVIS。
引用
@article{arxiv.2512.15885,
title = {Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models},
author = {Davide Caffagni and Sara Sarto and Marcella Cornia and Lorenzo Baraldi and Pier Luigi Dovesi and Shaghayegh Roohi and Mark Granroth-Wilding and Rita Cucchiara},
journal= {arXiv preprint arXiv:2512.15885},
year = {2025}
}