从孤立技能到日常物理自主:推进全能模态具身智能体
机器人学
2026-06-25 v1 人工智能
摘要
在非结构化环境中构建持久具身智能体,需要统一编排跨越赛博(API、IoT)与物理(操控、导航)领域的异构工具,并能在长时间运行中不可避免出现的物理故障下自主恢复。现有系统将这些视为独立问题:基于 VLM 的规划器缺乏统一的赛博-物理动作空间,智能体框架累积无界上下文以致时间一致性退化,而 VLA 策略以开环方式执行且不检测自身故障。我们认为,持久自主需要的不是单体模型,而是具有规划、记忆与验证明确分离的分层异步架构。为此,我们提出 OmniAct 框架,其集成了用于统一动作空间内技能路由的多模态语义规划器、具有事件边界驱动压缩以实现亚线性上下文增长的自适应分层记忆,以及在物理执行期间闭合语义环的异步视觉抢占引擎。在两个机器人平台协调四个 IoT 设备的 40 项真实世界长程任务中,OmniAct 在所有复杂度级别上均实现端到端成功率的持续提升,在 100k+ 累积交互 token 下保持近乎平坦的 token 消耗,并将中等规模开放权重模型提升至专有级性能。
引用
@article{arxiv.2606.27251,
title = {Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy},
author = {Junhao Shi and Zezheng Huai and Siyin Wang and Jia Chen and Yubang Wang and Zhaoye Fei and Hechang Chen and Jingjing Gong and Xipeng Qiu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2606.27251},
year = {2026}
}