中文

基于遮盖视觉相关推理的多模态强化预训练框架

计算机视觉与模式识别 2025-12-09 v1

摘要

多模态预训练受限于图像-caption对的描述性偏见,导致模型偏向表面语言线索而忽视基于视觉的理解。我们提出MMRPT(MultiModal Reinforcement Pre-Training),一种基于遮盖视觉相关推理的多模态强化预训练框架,以强化MLLMs的视觉推理能力。我们是首次将强化学习直接引入大型视觉语言模型的预训练中,实现以视觉 grounding 为奖励信号的学习,而非caption模仿。MMRPT通过对视觉token上的注意力估计句子级视觉依赖性并遮盖高度视觉相关片段;模型通过以语义-视觉奖励为导向,对这些片段进行视觉 grounding 重构。实验显示,在多样化基准测试上实现持续的零样性能提升,并在监督微调后显著提升鲁棒性,表明强化驱动的遮盖推理为多模态模型提供了更可靠且更具通用性的预训练目标。

关键词

引用

@article{arxiv.2512.07203,
  title  = {MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning},
  author = {Xuhui Zheng and Kang An and Ziliang Wang and Yuhang Wang and Faqiang Qian and Yichao Wu},
  journal= {arXiv preprint arXiv:2512.07203},
  year   = {2025}
}

备注

7 pages, 1 figures