中文

SPHINX:用于视觉感知与推理的合成环境

计算机视觉与模式识别 2026-04-07 v2 人工智能 机器学习

摘要

我们提出了 Sphinx,这是一个面向视觉感知与推理的合成环境,旨但解决核心认知原语问题。SPHINX 通过程序化生成包含图案、图块、图表、图标和几何原语的拼图,每个元素都配有可验证的真实解答,旨但既实现精确评估,又构建大规模数据集。该基准涵盖 25 种任务类型,涉及对称性检测、几何变换、空间推理、图表解读和序列预测。评估最新大型视觉语言模型(LVLMs)时显示,甚至领先的 GPT-5 仅达到 51.1% 的准确率,远低于人类的水平。最后,我们展示了使用可验证奖励的强化学习(RLVR)可显著提升模型在这些任务上的准确率,并在外部视觉推理基准中取得提升,凸显了其在多模态推理方面的潜力。

关键词

引用

@article{arxiv.2511.20814,
  title  = {SPHINX: A Synthetic Environment for Visual Perception and Reasoning},
  author = {Md Tanvirul Alam and Saksham Aggarwal and Justin Yang Chae and Nidhi Rastogi},
  journal= {arXiv preprint arXiv:2511.20814},
  year   = {2026}
}