中文

ESearch-R1:基于强化学习学习成本感知 MLLM 主体搜索代理

人工智能 2025-12-23 v1 计算机视觉与模式识别

摘要

多模态大型语言模型(MLLM)为具身代理在规划和推理方面赋予了惊人的能力。然而,在面对模糊的自然语言指令(例如在杂乱的房间中“获取工具”)时,当前代理往往难以在物理探索成本与人类交互认知成本之间进行权衡。它们通常将歧义消解视为被动感知问题,缺乏最小化总任务执行成本的战略推理能力。为弥合这一差距,我们提出了 ESearch-R1,一个成本感知的具身推理框架,将交互式对话(Ask)、情节记忆检索(GetMemory)和物理导航(Navigate)统一集成到单个决策过程中。我们引入 HC-GRPO(异构成本感知分组相对策略优化)。与传统 PPO 依赖独立价值评论家不同,HC-GRPO 通过抽取推理轨迹组并强化实现信息收益与异构成本(如导航时间和人类注意力)最佳权衡的轨迹来优化 MLLM。在 AI2-THOR 中的大量实验表明,ESearch-R1 显著优于基于标准 ReAct 的代理,提高了任务成功率,同时将总体操作成本约降低 50%,验证了 GRPO 在与物理世界约束对齐 MLLM 代理方面的有效性。

关键词

引用

@article{arxiv.2512.18571,
  title  = {ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning},
  author = {Weijie Zhou and Xuangtang Xiong and Ye Tian and Lijun Yue and Xinyu Wu and Wei Li and Chaoyang Zhao and Honghui Dong and Ming Tang and Jinqiao Wang and Zhengyou Zhang},
  journal= {arXiv preprint arXiv:2512.18571},
  year   = {2025}
}