面向语言引导抓取的物理代理循环及执行状态监控
机器人学
2026-04-10 v1 人工智能
计算机视觉与模式识别
摘要
跟随语言指令的机器人操作系统通常以单次为主的方式执行抓取原语:模型提出一个动作,机器人执行它,而诸如空抓、滑动、卡住、超时或语义错误抓取等故障在决策层面上并未以结构化方式暴露出来。受数字工具使用代理中的代理循环启发,我们将语言引导的抓取重新定义为在具体执行状态上运行的受限具身代理,物理动作暴露出明确的工具状态流。我们引入一种物理代理循环,将未修改的学习操作原语(抓取提升)封装于 (i) 基于事件的接口和 (ii) 执行监控层 Watchdog 之内,后者通过接触感知融合和时间稳定化将噪声的夹具遥测数据转换为离散的结果标签。这些结果事件(可选地与抓取后的语义验证相结合)被受限策略所消费,后者最终决定、重试或向用户请求澄清,确保有限的终止。我们在配备眼部手部 D405 相机的移动机械臂上验证了所得循环,保持底层抓取模型不变,并评估了涉及视觉模糊、干扰项以及诱发执行故障的代表性场景。结果表明,显式的执行状态监控和受限恢复比开环执行在更稳健、更可解释的行为方面具有优势,同时增加的架构开销最小。关于源代码和演示,请参阅我们的项目页面:https://wenzewwz123.github.io/Agentic-Loop/
引用
@article{arxiv.2604.07395,
title = {A Physical Agentic Loop for Language-Guided Grasping with Execution-State Monitoring},
author = {Wenze Wang and Mehdi Hosseinzadeh and Feras Dayoub},
journal= {arXiv preprint arXiv:2604.07395},
year = {2026}
}
备注
Project page: https://wenzewwz123.github.io/Agentic-Loop/