中文

VisReason:大规模视觉链式思维推理数据集

计算机视觉与模式识别 2025-11-25 v1 机器学习

摘要

链式思维(Chain-of-Thought, CoT)提示在激发大语言模型(LLM)复杂推理方面证明效果显著。然而,其在多模态大语言模型(MLLM)中的潜力仍未得到充分发挥,主要受制于缺乏捕捉视觉理解中富有层次性、空间导向推理的大规模数据集。现有视觉CoT资源通常规模较小、领域局限,或缺乏人类式的分步结构以支撑组合视觉推理。本文引入VisReason,一个大规模数据集旨� advance visual Chain-of-Thought推理。VisReason包含48.9万个标注实例,覆盖四个多样化领域,每个领域都包含多轮、类似人类的理性过程,引导MLLM经过可解释的视觉推理步骤。基于此,我们策划了VisReason-Pro,一个16.5万个子集,由更强大的专家级GPT标注器完成,增添了详细的推理痕迹及3D空间 grounding,深度信息标注支持下。对最新Qwen2.5-VL模型在VisReason和VisReason-Pro上微调,显著提升了逐步视觉推理准确率、可解释性及跨基准泛化能力。结果表明,VisReason使MLLM具备更系统、可泛化的推理能力。我们设想VisReason作为培育类人视觉推理的基石,为下一代多模态智能铺平了道路。

关键词

引用

@article{arxiv.2511.17731,
  title  = {VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning},
  author = {Lingxiao Li and Yifan Wang and Xinyan Gao and Chen Tang and Xiangyu Yue and Chenyu You},
  journal= {arXiv preprint arXiv:2511.17731},
  year   = {2025}
}