中文

通过 R1-Zero 类训练提升视觉-空间推理能力

计算机视觉与模式识别 2025-04-16 v2 人工智能

摘要

越来越多注意力被放在提高多模态大型语言模型(MLLMs)的推理能力上。作为功能于物理环境中的 AI 代理的基石,视频基于视觉的空间智能(VSI)成为 MLLMs 最关键的推理能力之一。本工作对如何通过 R1-Zero 类训练来提高 MLLMs 的视觉-空间推理能力进行首次深入研究。技术上,我们首先识别出小到中等规模的 Qwen2-VL 模型无法通过链式思考(CoT)提示激活其视觉-空间推理能力。随后,我们采用类似 DeepSeek-R1-Zero 的方法,对使用精心挑选的 VSI-100k 数据集进行 GRPO 训练以提升视觉-空间推理。调查过程中,我们识别出在 GRPO 中保留 KL 惩罚(即使数值较小)是必要的。仅需120个 GPU 小时,我们的 vsGRPO-2B 模型(基于 Qwen2-VL-2B 微调)即可超过基础模型12.1%,并超越 GPT-4o。此外,我们的 vsGRPO-7B 模型(基于 Qwen2-VL-7B 微调)的性能相当于最佳开源模型 LLaVA-NeXT-Video-72B。我们还比较了 vsGRPO 与监督微调和直接偏好优化基线,观察到其在性能上显著优于。代码和数据集将很快公开。

关键词

引用

@article{arxiv.2504.00883,
  title  = {Improved Visual-Spatial Reasoning via R1-Zero-Like Training},
  author = {Zhenyi Liao and Qingsong Xie and Yanhao Zhang and Zijian Kong and Haonan Lu and Zhenyu Yang and Zhijie Deng},
  journal= {arXiv preprint arXiv:2504.00883},
  year   = {2025}
}