中文

SenseNova-MARS:通过强化学习赋能多模态智能体推理与搜索

计算机视觉与模式识别 2026-01-27 v2

摘要

虽然视觉语言模型(VLM)可以通过智能体推理解决复杂任务,但它们的能力在很大程度上仍局限于面向文本的思维链或孤立的工具调用。它们未能展现出在知识密集型和视觉复杂场景中无缝交织动态工具操作与持续推理所需的人类般熟练度,特别是这些场景需要协调外部工具如搜索和图像裁剪。在这项工作中,我们引入了SenseNova-MARS,一个新颖的多模态智能体推理与搜索框架,通过强化学习(RL)赋予VLM交织的视觉推理和工具使用能力。具体而言,SenseNova-MARS动态整合图像搜索、文本搜索和图像裁剪工具,以应对细粒度和知识密集型视觉理解挑战。在RL阶段,我们提出了批量归一化组序列策略优化(BN-GSPO)算法,以改善训练稳定性并提升模型调用工具和有效推理的能力。为了全面评估智能体VLM在复杂视觉任务上的表现,我们引入了HR-MMSearch基准,这是首个面向搜索的基准,由高分辨率图像和知识密集型搜索驱动问题组成。实验表明SenseNova-MARS在开源搜索和细粒度图像理解基准上取得了最先进性能。具体而言,在面向搜索的基准上,SenseNova-MARS-32B在MMSearch上得分为74.3,在HR-MMSearch上得分为54.4,超越了Gemini-3-Pro和GPT-5.2等专有模型。SenseNova-MARS代表了通向智能体VLM的有前景的一步,通过提供有效且鲁棒的工具使用能力。为促进该领域的进一步研究,我们将发布所有代码、模型和数据集。

关键词

引用

@article{arxiv.2512.24330,
  title  = {SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning},
  author = {Yong Xien Chng and Tao Hu and Wenwen Tong and Xueheng Li and Jiandong Chen and Haojia Yu and Jiefan Lu and Hewei Guo and Hanming Deng and Chengjun Xie and Gao Huang and Dahua Lin and Lewei Lu},
  journal= {arXiv preprint arXiv:2512.24330},
  year   = {2026}
}