EO-1:面向通用机器人控制的开放统一具身基础模型
机器人学
2026-02-26 v5 人工智能
摘要
人类在开放世界中无缝执行多模态推理和物理交互的能力是通用具身智能系统的核心目标。最近的视觉-语言-动作 (VLA) 模型,这些模型是在大规模机器人和视觉-文本数据上联合训练,已在通用机器人控制方面取得显著进展。然而,它们仍未实现人类水平的灵活性,以交错的方式进行推理和交互。本文介绍了 EO-Robotics,包括 EO-1 模型和 EO-Data1.5M 数据集。EO-1 是一个统一的具身基础模型,通过交错的视觉-文本-动作预训练,在具身推理和机器人控制方面实现了卓越的性能。EO-1 的开发基于两个关键支柱:(i) 能够无差别处理多模态输入 (图像、文本、视频和动作) 的统一架构;(ii) 包含超过 150 万个样本的大规模高质量多模态具身推理数据集 EO-Data1.5M,后者强调交错的视觉-文本-动作理解。EO-1 通过在 EO-Data1.5M 上进行自回归解码和流匹配去噪的协同训练,实现了无缝的机器人动作生成和多模态具身推理。广泛的实验表明,交错的视觉-文本-动作学习对于开放世界理解和泛化非常有效,通过多种长期臂长操作任务在多个 embodiment 中进行了验证。本文详细介绍了 EO-1 的架构、EO-Data1.5M 的数据构建策略以及训练方法,为开发高级具身基础模型提供了宝贵的见解。项目页面:https://eo-robotics.ai/eo-1。
引用
@article{arxiv.2508.21112,
title = {EO-1: An Open Unified Embodied Foundation Model for General Robot Control},
author = {Delin Qu and Haoming Song and Qizhi Chen and Zhaoqing Chen and Xianqiang Gao and Dong Wang and Xinyi Ye and Qi Lv and Modi Shi and Guanghui Ren and Cheng Ruan and Maoqing Yao and Haoran Yang and Jiacheng Bao and Bin Zhao and Xuelong Li},
journal= {arXiv preprint arXiv:2508.21112},
year = {2026}
}