面向具身代理 AI:LLM 和 VLM 驱动的机器人自主性与交互综述与分类
机器人学
2025-11-14 v4 人工智能
机器学习
摘要
基础模型,包括大型语言模型 (LLM) 和视觉语言模型 (VLM),最近促进了机器人自主性和人机界面新方法的出现。同时,视觉语言-行动模型 (VLA) 或大型行为模型 (LBM) 正在提高机器人系统的灵活性和能力。本综述论文回顾了推进代理应用和架构的工作,包括最初的 GPT 风格界面和更复杂的系统,其中 AI 代理充当协调器、计划者、感知者或通用接口。此类代理架构允许机器人对自然语言指令进行推理、调用 API、规划任务序列或协助操作和诊断。除了同行评审研究之外,鉴于该领域快速演变,本文还突出并包括社区驱动的项目、ROS 软件包和工业框架,以显示新兴趋势。我们提出了用于分类模型集成方法的分类法,并呈现了今天文献中代理在不同解决方案中所扮演角色的比较分析。
引用
@article{arxiv.2508.05294,
title = {Towards Embodied Agentic AI: Review and Classification of LLM- and VLM-Driven Robot Autonomy and Interaction},
author = {Sahar Salimpour and Lei Fu and Kajetan Rachwał and Pascal Bertrand and Kevin O'Sullivan and Robert Jakob and Farhad Keramat and Leonardo Militano and Giovanni Toffetti and Harry Edelman and Jorge Peña Queralta},
journal= {arXiv preprint arXiv:2508.05294},
year = {2025}
}