AgenticLab:一个具备视觉、推理与执行能力的真实机器人智能体平台
机器人学
2026-03-10 v3
摘要
近期大型视觉语言模型(VLM)的进展表明其具备通用且可解释的感知与推理能力,但其在非结构化、野生环境下进行长时序、闭环执行的真实机器人操控能力尚不明朗。现有基于VLM的操控管线难以在不同研究团队的实验 setup 下进行比较,许多评估仍依赖仿真、特权状态或专门设计的环境。我们提出AgenticLab,一个面向开放世界操控的模型无关机器人智能体平台与基准测试。AgenticLab提供感知、任务分解、在线验证与重新规划的闭环智能体管线。通过AgenticLab,我们对最新基于VLM的智能体在非结构化真实机器人任务上进行基准测试。我们的基准测试揭示了若干离线视觉语言测试(如VQA和静态图像理解)未能捕获的失败模式,包括:多步骤定位一致性失效、遮挡与场景变更下的目标定位不足、以及可靠操控的空间推理不足。我们将发布完整的硬件与软件堆栈,以支持可重复评估并加速通用机器人智能体的研究。
引用
@article{arxiv.2602.01662,
title = {AgenticLab: A Real-World Robot Agent Platform that Can See, Think, and Act},
author = {Pengyuan Guo and Zhonghao Mai and Zhengtong Xu and Kaidi Zhang and Heng Zhang and Zichen Miao and Arash Ajoudani and Zachary Kingston and Qiang Qiu and Yu She},
journal= {arXiv preprint arXiv:2602.01662},
year = {2026}
}
备注
Added appendix