在 Veo 世界模拟器中评估 Gemini Robotics 策略
机器人学
2026-01-07 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
生成式世界模型在模拟与视觉运动策略在不同环境中的交互方面具有巨大潜力。前沿视频模型能够以可扩展且通用的方式生成逼真的观测和环境交互。然而,视频模型在机器人学中的应用主要局限于分布内评估,即与训练策略或微调基础视频模型所用场景相似的场景。在本报告中,我们证明视频模型可用于机器人策略评估的整个谱系:从评估标称性能到分布外(OOD)泛化,以及探测物理和语义安全性。我们引入了一个基于前沿视频基础模型(Veo)构建的生成式评估系统。该系统经过优化以支持机器人动作条件化和多视图一致性,同时整合生成式图像编辑和多视图补全来沿多个泛化轴合成真实世界场景的逼真变体。我们证明该系统保留了视频模型的基础能力,使其能够准确模拟经过编辑以包含新颖交互物体、新颖视觉背景和新颖干扰物体的场景。这种保真度使得能够准确预测不同策略在标称和 OOD 条件下的相对性能,确定不同泛化轴对策略性能的影响,以及对策略进行红队测试以暴露违反物理或语义安全约束的行为。我们通过 1600 多项真实世界评估验证了这些能力,涉及双臂操作器的八个 Gemini Robotics 策略检查点和五个任务。
引用
@article{arxiv.2512.10675,
title = {Evaluating Gemini Robotics Policies in a Veo World Simulator},
author = {Gemini Robotics Team and Krzysztof Choromanski and Coline Devin and Yilun Du and Debidatta Dwibedi and Ruiqi Gao and Abhishek Jindal and Thomas Kipf and Sean Kirmani and Isabel Leal and Fangchen Liu and Anirudha Majumdar and Andrew Marmon and Carolina Parada and Yulia Rubanova and Dhruv Shah and Vikas Sindhwani and Jie Tan and Fei Xia and Ted Xiao and Sherry Yang and Wenhao Yu and Allan Zhou},
journal= {arXiv preprint arXiv:2512.10675},
year = {2026}
}