S1-VL:具备“以图思考”能力的科学多模态推理模型
计算机视觉与模式识别
2026-04-24 v1
摘要
我们提出S1-VL,一个面向科学领域的多模态推理模型,它原生支持两种互补的推理范式:科学推理,依赖于结构化的思维链;以及以图思考,使模型能够在推理过程中通过执行Python代码主动操作图像。在以图思考模式下,模型在沙箱环境中生成并执行图像处理代码,获取中间视觉结果,并以多轮迭代的方式继续推理。这种设计对于高分辨率科学图表解读、显微图像理解和几何辅助推理等具有挑战性的场景特别有效。为了构建训练数据,我们收集了涵盖数学、物理、化学、天文学、地理学和生物学六个学科的科学多模态数据集。我们进一步为推理轨迹开发了一个六维质量过滤框架。为了减少现有数据集中常见的冗余、无效和错误的视觉操作,我们提出了一个多阶段过滤流程以及一个自适应数据路由策略。该策略将视觉信息增益低的样本转换为纯推理模式数据,使模型能够学习何时真正需要图像操作。S1-VL通过一个四阶段渐进式流程进行训练:科学多模态SFT、以图思考冷启动SFT,以及两个阶段的SAPO强化学习。我们在Qwen3-VL-32B-Thinking基础上构建了S1-VL-32B,并在13个基准上进行了评估。实验结果表明,S1-VL-32B在所有五个以图思考基准(包括HRBench-4K、HRBench-8K、MME-RealWorld-CN、MME-RealWorld-Lite和V*)上取得了最先进的性能,并且在科学推理基准(如Physics和VRSBench)上优于对比系统。
引用
@article{arxiv.2604.21409,
title = {S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images},
author = {Qingxiao Li and Lifeng Xu and QingLi Wang and Yudong Bai and Mingwei Ou and Shu Hu and Nan Xu},
journal= {arXiv preprint arXiv:2604.21409},
year = {2026}
}
备注
29 pages, 13 figures