部署期间的自监督策略自适应
机器学习
2021-04-12 v3 计算机视觉与模式识别
机器人学
机器学习
摘要
在大多数现实场景中,在一个环境中通过强化学习训练的策略需要部署到另一个可能截然不同的环境中。然而,已知跨不同环境的泛化非常困难。一个自然的解决方案是在新环境中部署后继续训练,但如果新环境不提供奖励信号,则无法实现。我们的工作探索了使用自监督来允许策略在部署后无需任何奖励即可继续训练。虽然先前的方法明确预期新环境中的变化,但我们假设对这些变化没有先验知识,却仍获得了显著改进。我们在 DeepMind Control suite 和 ViZDoom 的多种模拟环境,以及持续变化环境中从未校准相机获取观测的真实机器人操作任务上进行了实证评估。我们的方法在跨各种任务的 36 个环境中的 31 个上改善了泛化能力,并在大多数环境上优于域随机化。
引用
@article{arxiv.2007.04309,
title = {Self-Supervised Policy Adaptation during Deployment},
author = {Nicklas Hansen and Rishabh Jangir and Yu Sun and Guillem Alenyà and Pieter Abbeel and Alexei A. Efros and Lerrel Pinto and Xiaolong Wang},
journal= {arXiv preprint arXiv:2007.04309},
year = {2021}
}
备注
Website: https://nicklashansen.github.io/PAD/ Code: https://github.com/nicklashansen/policy-adaptation-during-deployment ICLR 2021