DINO-WM:基于预训练视觉特征的世界模型实现零样法规划
机器人学
2025-02-04 v2 人工智能
摘要
给定控制动作预测未来结果的能力是物理推理的基本能力。然而,这类预测模型(常称为世界模型)难以学习,通常仅针对特定任务开发,需在在线策略学习中实现。为充实发挥世界模型的潜力,我们认为其应 1)基于离线预收集的轨迹进行训练,2)支持测试时行为优化,3)促进任务无关的推理。为此,我们提出 DINO 世界模型(DINO-WM),一种不通过重构视觉世界来建模视觉动态的新方法。DINO-WM 利用使用 DINOv2 预训练的空间 patch 特征,使其能够通过预测未来 patch 特征从离线行为轨迹中学习。这使得 DINO-WM 能够通过动作序列优化实现观测目标,从而通过将目标特征视为预测目标来实现任务无关的规划。我们展示,DINO-WM 在六个环境中实现零样法行为解决方案,无需专家演示、奖励建模或预学习逆模型,凭借在各种任务族(如任意配置的迷宫、带不同物体形状的推动操作、多粒子场景)中相较于先前最先进工作的表现而表现突出。
引用
@article{arxiv.2411.04983,
title = {DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning},
author = {Gaoyue Zhou and Hengkai Pan and Yann LeCun and Lerrel Pinto},
journal= {arXiv preprint arXiv:2411.04983},
year = {2025}
}