循环策略蒸馏:基于域随机化的样本高效仿真到现实强化学习
机器人学
2023-04-11 v2 机器学习
摘要
带有域随机化的深度强化学习在各种具有随机化物理与传感器模型参数的仿真中学习控制策略,以在零样本设定下可迁移至真实世界。然而,当随机化参数范围较广时,由于策略更新的不稳定性,常需大量样本来学习有效策略。为缓解此问题,我们提出一种名为循环策略蒸馏(CPD)的样本高效方法。CPD 将随机化参数范围划分为若干小子域,并为每个子域分配一个局部策略。随后在循环切换子域的同时学习局部策略。CPD 基于期望性能提升通过知识迁移加速学习。最后,所有学习到的局部策略被蒸馏为一个用于仿真到现实迁移的全局策略。CPD 的有效性与样本效率通过四个任务的仿真(来自 OpenAIGym 的 Pendulum 以及来自 Mujoco 的 Pusher、Swimmer 和 HalfCheetah)和一个真实机器人散球任务得到验证。我们在 https://github.com/yuki-kadokawa/cyclic-policy-distillation 发布了实验代码与视频。
引用
@article{arxiv.2207.14561,
title = {Cyclic Policy Distillation: Sample-Efficient Sim-to-Real Reinforcement Learning with Domain Randomization},
author = {Yuki Kadokawa and Lingwei Zhu and Yoshihisa Tsurumine and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2207.14561},
year = {2023}
}