请走出来说话:通过多模态代理策略优化搭建推理-行动鸿沟,以图像思考
计算机视觉与模式识别
2026-04-09 v1
摘要
最近的多模态大型语言模型(MLLMs)进展推动模型主动调用视觉工具以进行多轮推理。常见的强化学习做法依赖于基于结果的奖励,忽略了文本合理性常常掩盖执行失效的事实,即模型可能在其 agentic reasoning 轨迹中表现出直观的文本推理,同时执行不精确或无关的视觉动作。这种推理-行动差距引入的噪声在多轮推理过程中会累积,严重降低模型的多模态推理能力,甚至可能导致训练崩溃。本文引入多模态代理策略优化(MAPO),在 MLLMs 的多模态链路思考(MCoT)中搭建文本推理与视觉动作生成之间的鸿沟。具体而言,MAPO 要求模型为通过工具获取的视觉内容生成明确的文本描述。我们 then 使用一种新型优势估计方法,将这些描述与实际观察之间的语义对齐与任务奖励耦合。提供理论依据以论证 MAPO 的理念,由于本质上降低了梯度方差,MAPO 在多个视觉推理基准测试中实现了优异性能。
引用
@article{arxiv.2604.06777,
title = {Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization},
author = {Wenhao Yang and Yu Xia and Jinlong Huang and Shiyin Lu and Qing-Guo Chen and Zhao Xu and Weihua Luo and Kaifu Zhang and Yuchen Zhou and Xiaobo Xia and Yuanyu Wan and Lijun Zhang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2604.06777},
year = {2026}
}