PhysiAgent:物理世界中的具身智能体框架
机器人学
2025-09-30 v1 人工智能
系统与控制
系统与控制
摘要
视觉-语言-动作(VLA)模型已取得显著成功,但通常在泛化方面存在局限。为解决这一问题,将通用视觉语言模型(VLMs)作为VLA的辅助工具已成为一种流行的解决方案。然而,当前方法通常以刚性的顺序结构组合这些模型:主要将VLMs用于高层场景理解和任务规划,而将VLAs仅用作低层动作的执行器,导致协作效率低下和接地挑战。在本文中,我们提出了一个面向物理环境有效运行的具身智能体框架PhysiAgent。通过引入监控、记忆、自我反思机制以及轻量级现成工具箱,PhysiAgent提供了一个自主支架框架,根据VLA提供的实时能力反馈提示VLMs组织不同组件,以最大化利用VLA的能力。实验结果表明,在复杂真实世界机器人任务上的任务求解性能显著提升,展示了VLMs的有效自我调节、连贯的工具协作以及执行过程中框架的自适应演化。PhysiAgent在将VLMs和VLAs整合方面做出了实用且开创性的努力,有效地将具身智能体框架扎根于真实世界环境中。
引用
@article{arxiv.2509.24524,
title = {PhysiAgent: An Embodied Agent Framework in Physical World},
author = {Zhihao Wang and Jianxiong Li and Jinliang Zheng and Wencong Zhang and Dongxiu Liu and Yinan Zheng and Haoyi Niu and Junzhi Yu and Xianyuan Zhan},
journal= {arXiv preprint arXiv:2509.24524},
year = {2025}
}