SeePhys Pro:诊断多模态 RLVR 中模态迁移与盲训练效应
人工智能
2026-05-13 v2
摘要
我们提出 SeePhys Pro,一个细粒度的模态迁移基准,用于研究模型在关键信息从文本逐步迁移到图像时是否保持相同的推理能力。不同于评估单一输入形式的标准视觉-essential 基准,SeePhys Pro 为每个问题提供四个在语义上对齐的变体,视觉元素呈递增形式。我们的评估显示,当前前沿模型距离表征无关的推理器尚远未至:随着信息从语言向图表示增加,性能平均下降,视觉变量 grounding 是最关键的瓶颈。针对推理时脆弱性,我们进一步开发了大规模多模态 RLVR 训练语料库,并采用盲训练作为诊断控制,发现即使所有训练图像被遮盖的 RL 仍能提升未遮盖验证集的性能。为分析此效应,文本删除、图像遮盖率和格式饱和度控制表明,这类收益可能源于残余文本和分布性线索,而非有效的视觉证据。我们的结果凸显,不仅要通过最终答案准确率评估多模态推理,还需在模态迁移下鲁棒性方面进行评估,并通过诊断性测试来判断改进是否依赖于任务关键视觉证据。
引用
@article{arxiv.2605.09266,
title = {SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning},
author = {Kun Xiang and Terry Jingchen Zhang and Zirong Liu and Bokai Zhou and Yueling Tang and Junjie Yu and Jiacong Lu and Shangrui Huang and Heng Li and Likui Zhang and Kunkun Liu and Changzheng Zhang and Yangle Fang and Boqiang Guo and Hui-Ling Zhen and Dandan Tu and Yinya Huang and Xiaodan Liang},
journal= {arXiv preprint arXiv:2605.09266},
year = {2026}
}