MuSEAgent:具备无状态经验的多模态推理智能体
计算机视觉与模式识别
2026-03-31 v1
摘要
近期,研究智能体在异构文本与视觉来源之间取得了显著进展。本文介绍 MuSEAgent,这是一种多模态推理智能体,通过扩展研究智能体的能力以发现和利用无状态经验来增强决策。我们提出一种无状态经验学习范式,将交互数据抽象为通过后见之明推理得到的原子决策经验。这些经验被组织进一个质量过滤的经验库,以支持在推理时进行策略驱动的经验检索。具体而言,MuSEAgent 通过互补的宽搜和深搜策略,实现了对多样化组合语义视角的动态检索。大量实验表明,MuSEAgent 在细粒度视觉感知和复杂多模态推理任务上 consistently 优于强于基于轨迹级经验检索的基线方法。这些结果验证了无状态经验建模在改进多模态智能体推理方面的有效性。
引用
@article{arxiv.2603.27813,
title = {MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences},
author = {Shijian Wang and Jiarui Jin and Runhao Fu and Zexuan Yan and Xingjian Wang and Mengkang Hu and Eric Wang and Xiaoxi Li and Kangning Zhang and Li Yao and Wenxiang Jiao and Xuelian Cheng and Yuan Lu and Zongyuan Ge},
journal= {arXiv preprint arXiv:2603.27813},
year = {2026}
}