LS3:用于稀疏奖励迭代任务长视野视觉运动控制的潜空间安全集
机器学习
2021-09-22 v2 人工智能
机器人学
摘要
强化学习(RL)在探索高维环境以学习复杂任务方面已展现出令人印象深刻的成效,但在探索不受约束时,常表现出不安全行为且需要大量的环境交互。在动态不确定环境中学习的一种有前景的策略是要求智能体能够鲁棒地返回到已学习的安全集,在那里可以保证任务成功(因而也是安全的)。尽管该方法在低维中已取得成功,但在具有视觉观测的环境中施加此约束极具挑战性。我们通过将安全集框定为所学潜空间中的二分类问题,提出了一种新颖的连续安全集表示,其可灵活扩展到图像观测。随后我们提出一种新算法,潜空间安全集(LS3),它利用该表示处理具有稀疏奖励的长视野任务。我们在 4 个领域上评估了 LS3,包括一个具有挑战性的仿真顺序推物任务和一个物理线缆布线任务。我们发现,LS3 可利用先前的任务成功来限制探索,并在满足约束的同时比先前的算法学习得更高效。参见 https://tinyurl.com/latent-ss 获取代码与补充材料。
引用
@article{arxiv.2107.04775,
title = {LS3: Latent Space Safe Sets for Long-Horizon Visuomotor Control of Sparse Reward Iterative Tasks},
author = {Albert Wilcox and Ashwin Balakrishna and Brijen Thananjeyan and Joseph E. Gonzalez and Ken Goldberg},
journal= {arXiv preprint arXiv:2107.04775},
year = {2021}
}
备注
Conference on Robot Learning (CoRL) 2021. First two authors contributed equally