VisualSphinx:面向强化学习的大规模合成视觉逻辑谜题
计算机视觉与模式识别
2025-06-02 v1 人工智能
机器学习
摘要
视觉语言模型(VLMs)应能执行有效的多模态推理并做出逻辑连贯的决策,这对于图表理解和空间问题求解等任务至关重要。然而,当前的 VLM 推理缺乏大规模且结构良好的训练数据集。为了弥补这一空白,我们提出了 VisualSphinx,一种首创的大规模合成视觉逻辑推理训练数据。为了应对带有基础答案的图像合成挑战,我们提出了一种规则到图像的合成流水线,该流水线从种子问题中提取并扩展谜题规则,并生成用于谜题样本组装的基础合成图像合成代码。实验表明,在 VisualSphinx 上使用 GRPO 训练的 VLM 受益于我们数据集的逻辑连贯性和可读性,并在逻辑推理任务中表现出提升的性能。从 VisualSphinx 获得的增强推理能力也有益于其他推理任务,如代数推理、算术推理和几何推理。
引用
@article{arxiv.2505.23977,
title = {VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL},
author = {Yichen Feng and Zhangchen Xu and Fengqing Jiang and Yuetai Li and Bhaskar Ramasubramanian and Luyao Niu and Bill Yuchen Lin and Radha Poovendran},
journal= {arXiv preprint arXiv:2505.23977},
year = {2025}
}
备注
Project page at https://visualsphinx.github.io/