SATORI-R1:通过显式视觉锚点激励多模态推理
计算机视觉与模式识别
2025-12-04 v2 人工智能
摘要
DeepSeek-R1通过稳定的强化学习在文本领域展现出强大的推理能力。最近,在多模态领域,一些研究开始直接将RL应用于生成类似R1的自由形式推理,用于视觉问答(VQA)任务。然而,多模态任务与文本任务在本质上存在不同之处,严重依赖对输入图像理解来解决问题。因此,此类自由形式推理在VQA任务中面临两个关键限制:(1)扩展的推理链会稀释对任务关键区域的视觉注意力,降低答案准确率。(2)不可验证的中间步骤会放大策略梯度方差和计算成本开销。为解决这些问题,本文引入SATORI(Spatially Anchored Task Optimization with Reinforcement Learning),将VQA分解为三个可验证阶段:全局图像描述、区域定位和答案预测,每个阶段都提供显式的奖励信号。此外,我们还引入了VQA-Verify,一个包含1.2万个带有答案对齐描述和边界框注释的数据集,以促进训练。实验表明,在七个VQA基准测试中,SATORI-R1 consistently实现了性能提升,相较于R1-like基线实现了最高15.7%的准确率提升。我们的注意力图分析确认了对关键区域的增强关注,这带来了准确率的提升。我们的代码可在https://github.com/justairr/SATORI-R1 获取。
引用
@article{arxiv.2505.19094,
title = {SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring},
author = {Chuming Shen and Wei Wei and Xiaoye Qu and Yu Cheng},
journal= {arXiv preprint arXiv:2505.19094},
year = {2025}
}
备注
21 pages, 8 figures