中文

RL 使 MLLMs 的视觉表征优于 SFT

计算机视觉与模式识别 2026-04-14 v2 机器学习

摘要

在多模态语言模型 (MLLM) 研究中,一个占主导地位的假设是其性能很大程度上继承自 LLM 主干,因为其参数规模庞大且功能突出。这导致对如何理解视觉编码器的缺乏关注——而这决定了 MLLMs 如何感知图像。最近 MLLM 训练范式从监督微调 (SFT) 转向强化学习 (RL),放大了这一忽视——即对训练如何重塑视觉编码器以及 MLLM 的显著性不足的分析。为此,我们首先研究训练策略对 MLLMs 的影响,其中 RL 在与视觉相关的 VQA benchmark 中显著优于 SFT。为了这一发现,我们通过多样且深入的实验,对 MLLMs 的视觉编码器进行关键且不足以探索的分析,包括 ImageNet 分类和分割以及梯度可视化。我们的结果表明,MLLM 的后训练策略(即 SFT 或 RL)不仅导致 MLLM 下游任务中存在差异,还根本性地重塑了 MLLM 的底层视觉表征。我们的研究的关键发现是,RL 产生更强且更精确定位的视觉表征,这提高了视觉编码器为 MLLMs 的能力。我们将我们的发现重新框定为一种简单的 MLLMs 视觉编码器构建配方,即 Preference-Instructed Vision OpTimization (PIVOT)。当集成到 MLLMs 中时,PIVOT 训练的视觉编码器甚至超过了更大且更密集训练的模型,尽管其计算成本不足标准视觉预训练的 1%。这一结果为推进 MLLMs 的视觉主干开辟了一条有效且高效的路径。项目页面可在 https://june-page.github.io/pivot/ 查看。

关键词

引用

@article{arxiv.2510.16333,
  title  = {RL makes MLLMs see better than SFT},
  author = {Junha Song and Sangdoo Yun and Dongyoon Han and Jaegul Choo and Byeongho Heo},
  journal= {arXiv preprint arXiv:2510.16333},
  year   = {2026}
}