中文

MA-VLCM:面向多智能体团队环境中基于价值估计的视觉语言批评模型

机器人学 2026-03-17 v1 人工智能

摘要

多智能体强化学习(Multi-agent reinforcement learning,MARL)通常依赖集中式批评者来估计价值函数。然而,如何从零学习这样的批评者高度样本低效且往往缺乏跨环境的泛化能力。同时,大型视觉语言-动作模型(vision-language-action models,VLAs)已在互联网规模数据上训练,展现出强大的多模态推理和零样本泛化能力,但直接将其部署用于机器人执行仍然计算上昂贵,尤其是在具有多样化本体化和资源约束的异构多机器人系统中。为此,我们提出了多智能体视觉语言批评模型(Multi-Agent Vision-Language-Critic Models,MA-VLCM),该框架用预训练的视觉语言模型取代 MARL 中的学习型集中式批评者,通过微调后可用于评估多智能体行为。MA-VLCM 作为一种基于自然语言任务描述、视觉轨迹观察和结构化多智能体状态信息的集中式批评者进行条件化。通过在策略优化期间消除批评者学习,本方法显著提高了样本效率,同时产生适用于资源受限机器人部署的紧凑型执行策略。结果表明,在多智能体团队环境中,基于不同 VLM backbone 的模型在分布内和分布外场景下均能良好地进行零样本回报估计。

关键词

引用

@article{arxiv.2603.15418,
  title  = {MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings},
  author = {Shahil Shaik and Aditya Parameshwaran and Anshul Nayak and Jonathon M. Smereka and Yue Wang},
  journal= {arXiv preprint arXiv:2603.15418},
  year   = {2026}
}

备注

7 pages, 6 figures