MELD:基于潜在状态模型从图像进行元强化学习
机器学习
2021-01-12 v2 人工智能
计算机视觉与模式识别
机器人学
摘要
元强化学习算法能够使机器人等自主智能体通过在一系列相关训练任务中利用先验经验快速习得新行为。然而,元训练繁重的数据需求,加上从图像等感官输入中学习的挑战,使得元强化学习难以应用于真实机器人系统。潜在状态模型从一系列观测中学习紧凑的状态表示,可加速从视觉输入中的表示学习。在本文中,我们利用将元学习视为任务推断的视角,表明潜在状态模型在适当定义的观测空间下也可以执行元学习。基于这一洞见,我们开发了具有潜在动力学的元强化学习(MELD),一种从图像进行元强化学习的算法,该算法在潜在状态模型中执行推断,以在给定观测和奖励的情况下快速习得新技能。MELD在多个模拟的基于图像的机器人控制问题上优于先前的元强化学习方法,并使真实的WidowX机械臂在仅经过小时真实世界元训练后,在给定稀疏任务完成信号的情况下将以太网电缆插入新位置。据我们所知,MELD是首个在真实世界机器人控制环境中从图像训练的元强化学习算法。
引用
@article{arxiv.2010.13957,
title = {MELD: Meta-Reinforcement Learning from Images via Latent State Models},
author = {Tony Z. Zhao and Anusha Nagabandi and Kate Rakelly and Chelsea Finn and Sergey Levine},
journal= {arXiv preprint arXiv:2010.13957},
year = {2021}
}
备注
Accepted to CoRL 2020. Supplementary material at https://sites.google.com/view/meld-lsm/home . 16 pages, 19 figures. V2: add funding acknowledgements, reduce file size