Genie Envisioner:面向机器人操作的统一世界基础平台
机器人学
2025-11-05 v3 计算机视觉与模式识别
摘要
我们介绍了 Genie Envisioner (GE),这是一个面向机器人操作的统一世界基础平台,将策略学习、评估和仿真集成到单一的视频生成框架中。其核心是 GE-Base,一个大规模、以指令为条件的视频扩散模型,能够在结构化的潜在空间中捕捉真实世界机器人交互的空间、时间和语义动态。建立在此基础上的 GE-Act 通过一个轻量级的流匹配解码器将潜在表示映射到可执行的动作轨迹,从而实现跨多种本体构件的精确且可泛化的策略推断。为支持可扩展的评估和训练,GE-Sim 作为一种基于动作的神经网络模拟器,能够生成高保真的滚动结果,用于闭环策略开发。该平台还配备了 EWMBench,这是一个标准化的基准套件,衡量视觉保真度、物理一致性和指令-动作对齐程度。总体而言,Genie Envisioner 作为面向指令驱动的通用具身智能的可扩展且实用的基础平台。所有代码、模型和基准将公开发布。
引用
@article{arxiv.2508.05635,
title = {Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation},
author = {Yue Liao and Pengfei Zhou and Siyuan Huang and Donglin Yang and Shengcong Chen and Yuxin Jiang and Yue Hu and Jingbin Cai and Si Liu and Jianlan Luo and Liliang Chen and Shuicheng Yan and Maoqing Yao and Guanghui Ren},
journal= {arXiv preprint arXiv:2508.05635},
year = {2025}
}
备注
https://genie-envisioner.github.io/