Latent Policy Steering:利用与具身无关的预训练世界模型
机器人学
2026-03-24 v4 人工智能
机器学习
摘要
学习到的机器人视觉运动策略的性能在很大程度上取决于训练数据集的大小和质量。尽管大规模机器人和人类数据集越来越可用,但具身差距和不匹配的动作空间使得它们难以被利用。我们的主要见解是,跨不同具身执行的技能会产生运动中的视觉相似性,这些相似性可以使用现成的动作表示(如光流)来捕捉。此外,世界模型(WMs)可以利用次优数据,因为它们专注于建模动态。在这项工作中,我们旨在通过首先使用光流作为与具身无关的动作表示来预训练一个WM,以利用来自多个具身(机器人、人类)的可访问或易于收集的数据,从而改善低数据情况下的视觉运动策略。给定目标具身上的少量演示,我们在此数据上微调WM以更好地对齐WM预测,训练一个基础策略,并学习一个鲁棒的价值函数。使用我们微调后的WM和价值函数,我们的方法评估来自基础策略的动作候选,并选择最佳的一个来提高性能。我们称之为潜在策略引导(LPS)的方法,在四个Robomimic任务上平均将行为克隆策略提升了10.6%,尽管大部分预训练数据来自真实世界。在真实世界实验中,LPS取得了更大的增益:与行为克隆基线相比,使用30-50个目标具身演示时相对提升70%,使用60-100个演示时相对提升44%。定性结果可在网站上找到:https://yiqiwang8177.github.io/LatentPolicySteering/。
引用
@article{arxiv.2507.13340,
title = {Latent Policy Steering with Embodiment-Agnostic Pretrained World Models},
author = {Yiqi Wang and Mrinal Verghese and Jeff Schneider},
journal= {arXiv preprint arXiv:2507.13340},
year = {2026}
}