DayDreamer:面向物理机器人学习的世界模型
机器人学
2022-06-29 v1 人工智能
机器学习
摘要
为在复杂环境中完成任务,机器人需要从经验中学习。深度强化学习是机器人学习的常用方法,但需要大量试错才能学习,限制了其在物理世界中的部署。因此,许多机器人学习的进展依赖于模拟器。另一方面,在模拟器内学习无法捕捉真实世界的复杂性,易受模拟器不准确性影响,且所得行为不能适应世界的变化。Dreamer 算法近来通过在学习的世界模型中规划、以少量交互进行学习展现出巨大前景,在视频游戏中超越纯强化学习。学习世界模型以预测潜在动作的结果,使得在想象中规划成为可能,减少真实环境中所需试错量。然而,Dreamer 是否能加速物理机器人学习尚未知。本文中,我们将 Dreamer 应用于 4 种机器人,在真实世界中直接在线学习,无需模拟器。Dreamer 训练四足机器人仅在 1 小时内从零开始且无重置地翻身、站立和行走。随后我们推动该机器人,发现 Dreamer 在 10 分钟内适应以承受扰动或快速翻滚并重新站起。在两种不同的机械臂上,Dreamer 直接从相机图像和稀疏奖励学习抓取并放置多个物体,接近人类表现。在轮式机器人上,Dreamer 纯从相机图像学习导航至目标位置,自动消解关于机器人朝向的歧义。在所有实验中采用相同超参数,我们发现 Dreamer 能够进行真实世界中的在线学习,确立了强基线。我们发布我们的基础设施以供未来世界模型在机器人学习中的应用。
引用
@article{arxiv.2206.14176,
title = {DayDreamer: World Models for Physical Robot Learning},
author = {Philipp Wu and Alejandro Escontrela and Danijar Hafner and Ken Goldberg and Pieter Abbeel},
journal= {arXiv preprint arXiv:2206.14176},
year = {2022}
}
备注
Website: https://danijar.com/daydreamer