面向全景视角推理的 360-R1:数据集、基准与基于 GRPO 的方法
计算机视觉与模式识别
2025-05-21 v1
摘要
全景图像(ODIs)因其 360{\deg} 视场,为沉浸式应用(如增强现实和具身 AI)提供了无与伦比的空间感知能力。然而,现有多模态大语言模型(MLLMs)理解和推理这类全景场景的能力仍未得到充分探索。本文通过引入 OmniVQA 数据集并首次构建全景视觉问答基准,填补了这一空白。我们评估了主流 MLLMs,发现其在处理全景视觉问答方面存在显著局限,尤其在对象定位、特征提取和全景情境下的幻觉抑制方面面临挑战。这些结果凸显了当前 MLLM 技能与全景视觉理解需求之间的鸿沟,迫切需要针对 360{\deg} 图像的专属架构或训练创新。基于 OmniVQA 数据集与基准,我们进一步提出基于 Qwen2.5-VL-Instruct 的规则强化学习方法 360-R1。具体而言,我们在组相对策略优化(GRPO)基础上提出三项新奖励函数:(1) 推理过程相似性奖励;(2) 答案语义准确性奖励;(3) 结构化格式合规性奖励。 OmniVQA 上的大量实验表明,我们的方法在全景空间中显著优于基准方法(提升约 6%)。
引用
@article{arxiv.2505.14197,
title = {Towards Omnidirectional Reasoning with 360-R1: A Dataset, Benchmark, and GRPO-based Method},
author = {Xinshen Zhang and Zhen Ye and Xu Zheng},
journal= {arXiv preprint arXiv:2505.14197},
year = {2025}
}