中文

HyCodePolicy:面向具身智能体多模态监测与决策的混合语言控制器

机器人学 2025-08-07 v2 人工智能 计算与语言

摘要

多模态大语言模型(Multimodal Large Language Models, MLLMs)的最新进展为具身智能体中代码策略的生成提供了更丰富的感知基础。然而,现有的大多数系统缺乏有效的机制来自适应地监测策略执行过程并在任务完成期间修复代码。在本工作中,我们引入 HyCodePolicy,一种基于混合语言的控制框架,它将代码合成、几何基础、感知监测以及迭代修复系统地集成到具身智能体的闭环编程循环中。在技术上,给定一条自然语言指令,我们的系统首先将其分解为子目标,并生成一个以对象为中心的几何基元为基础的可执行初始程序。随后该程序在仿真中执行,同时视觉-语言模型(Vision-Language Model, VLM)观察选定的检查点,以检测并定位执行失败并推断失败原因。通过融合捕获程序级事件的结构化执行轨迹与基于 VLM 的感知反馈,HyCodePolicy 推断失败原因并修复程序。这种混合双反馈机制使得在最少人工监督下的自校正程序合成成为可能。我们的结果表明,HyCodePolicy 显著提升了机器人操作策略的鲁棒性与样本效率,为将多模态推理集成到自主决策流水线提供了一种可扩展的策略。

关键词

引用

@article{arxiv.2508.02629,
  title  = {HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents},
  author = {Yibin Liu and Zhixuan Liang and Zanxin Chen and Tianxing Chen and Mengkang Hu and Wanxi Dong and Congsheng Xu and Zhaoming Han and Yusen Qin and Yao Mu},
  journal= {arXiv preprint arXiv:2508.02629},
  year   = {2025}
}

备注

Accepted to ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence