Pelican-Unify 1.0:统一的具身智能模型用于理解、推理、想象与行动
机器人学
2026-05-22 v2 人工智能
摘要
我们提出 Pelican-Unify 1.0,这是首个依据统一原则训练的具身基础模型。Pelican-Unify 1.0 使用单个 VLM 作为统一的理解模块,将场景、指令、视觉上下文和行动历史映射到共享语义空间。相同的 VLM 也作为统一的推理模块, autoregressively 生成任务、动作和面向未来的思考链,并将最终隐藏状态投射到稠密潜在变量。随后的 Unified Future Generator (UFG) 条件化于该潜在变量,并通过两个模态特定的输出头在同一去噪过程中联合生成未来视频和未来动作。语言、视频和动作损失全部反向传播到共享表示中,使模型能够在训练期间联合优化理解、推理、想象和行动,而不是训练三个孤立的专家系统。实验表明,统一范式并不意味着妥协。以单个 checkpoint,Pelican-Unify 1.0 在所有三个能力上均取得优异成绩:在八个 VLM 基准测试中取得 64.7 分,其中排名第一;在 WorldArena 上取得 66.03 分;在 RoboTwin 上取得 93.5 分,位列第 2。这些结果表明,统一范式在保持专家水平的同时,将理解、推理、想象和行动整合到一个模型中。
引用
@article{arxiv.2605.15153,
title = {Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action},
author = {Yi Zhang and Yinda Chen and Che Liu and Zeyuan Ding and Jin Xu and Shilong Zou and Junwei Liao and Jiayu Hu and Xiancong Ren and Xiaopeng Zhang and Yechi Liu and Haoyuan Shi and Zecong Tang and Haosong Sun and Renwen Cui and Kuishu Wu and Wenhai Liu and Yang Xu and Yingji Zhang and Yidong Wang and Senkang Hu and Jinpeng Lu and Nga Teng Chan and Yechen Wu and Zeting Liu and Xianzhou Hou and Yong Dai and Jian Tang and Xiaozhu Ju},
journal= {arXiv preprint arXiv:2605.15153},
year = {2026}
}