中文

DR-MMSearchAgent: 深化多模态搜索代理的推理能力

计算机视觉与模式识别 2026-04-22 v1

摘要

代理式多模态模型因能够利用外部工具解决复杂任务而受到广泛关注。然而, 观察到此类代理常发生早期交互坍缩, 其主要原因有两个: 1) 终端奖励仅附加在最后一个token上, 防止其区分具有探索性行为的轨迹; 2) 过度冗余的上下文阻碍了代理吸收有用反馈。为解决此问题, 我们提出了Deepening Reasoning MMSearchAgent框架, 通过结构相似性从整个batch中整个轨迹中派生奖励信号, 使得不同长度的轨迹即使包含相同正确答案也能得到鼓励。此外, 采用加权高斯奖励动态校准交互容忍度, 从而确保信息可靠性并减少冗余。为支持多轮交互训练, 我们构建了一个包含3602个高质量QA对的多步骤深层推理数据集, 每个QA对至少包含3个推理步骤。广泛的实验表明, 我们的方法在FVQA-test上超越MMSearch-R1 8.4%, 实现了最先进的性能。

关键词

引用

@article{arxiv.2604.19264,
  title  = {DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents},
  author = {Shengqin Wang and Wentao Yan and Huichi Zhou and Yihang Chen and Kun Shao and Zhizhong Zhang and Yuan Xie},
  journal= {arXiv preprint arXiv:2604.19264},
  year   = {2026}
}