中文

你得到了金色通行证:通过单个噪声向量提升生成式机器人策略

机器人学 2026-04-13 v2 人工智能

摘要

当预训练的生成式机器人策略 receives 一个恒定的初始噪声作为输入,而不是从高斯分布中重复抽样时,会发生什么?我们展示,提供一个精心选择的恒定初始噪声输入(所谓的金色通行证,golden ticket)可以提高预训练、冻结的扩散或 flow matching 策略相对于下游奖励的性能。我们提出一种搜索方法,通过蒙特卡洛策略评估来寻找金色通行证,该方法保持预训练策略冻结,不训练任何新网络,适用于所有扩散/flow matching 策略(因此也适用于许多视觉-语言-动作系统)。我们的策略改进方法仅要求能够注入初始噪声并计算(稀疏的)任务奖励的 episode rollout,无需额外基础设施或模型即可部署。我们的方法在 38 个 43 个模拟和真实世界机器人操作基准任务中均实现了性能提升,部分模拟任务的成功率提升最高可达 58%,真实世界任务在 50 次搜索 episodes 内提升 60%。我们还展示了金色通行证在多任务设置中的独特优势:不同通行证产生的行为多样性自然定义了 Pareto 前沿,用于在不同目标(如速度、成功率)之间进行权衡;在视觉-语言-动作系统中,我们发现为一个任务优化的金色通行证也能提升其他相关任务的性能。我们发布了包含预训练策略和金色通行证的代码库,用于使用视觉-语言-动作系统、扩散策略和 flow matching 策略的仿真基准。

关键词

引用

@article{arxiv.2603.15757,
  title  = {You've Got a Golden Ticket: Improving Generative Robot Policies With A Single Noise Vector},
  author = {Omkar Patil and Ondrej Biza and Thomas Weng and Karl Schmeckpeper and Wil Thomason and Xiaohan Zhang and Robin Walters and Nakul Gopalan and Sebastian Castro and Eric Rosen},
  journal= {arXiv preprint arXiv:2603.15757},
  year   = {2026}
}

备注

13 pages, 9 figures