中文

SPR-128K:面向多模态大语言模型空间合理性推理的新基准

计算机视觉与模式识别 2026-03-27 v2

摘要

近年来,图像生成的性能得到了显著提升。然而,对图像筛选的研究很少,且由于缺乏数据以及多模态大语言模型(MLLMs)空间合理性推理能力较弱,其在 MLLMs 上的表现不尽如人意。在这项工作中,我们提出了一种从数据和方法论层面解决这些问题的完整解决方案。在数据方面,我们收集了一个包含超过 128k 样本的全面空间合理性推理(SPR)数据集,称为 SPR-128K。该数据集从四个方面评估空间合理性推理能力。关于数据标注,我们研究了多种方法,以最具成本效益的方式获取高质量的思维链(Chain-of-Thought, CoT)数据。在方法论上,我们将动态比例精度(Dynamic Proportional Accuracy, DPA)奖励引入群组相对策略优化(Group Relative Policy Optimization, GRPO)框架,称为 DPA-GRPO。这种增强的方法相比原始 GRPO 展现出更优的性能。我们的实验表明,即使是领先的 MLLMs 在空间合理性推理上也表现不佳。相比之下,我们小得多的模型利用 DPA-GRPO,大幅超越了大型开源模型和领先的闭源模型。

关键词

引用

@article{arxiv.2505.23265,
  title  = {SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models},
  author = {Zhiyuan Hu and Zheng Sun and Yi Wei and Long Yu},
  journal= {arXiv preprint arXiv:2505.23265},
  year   = {2026}
}