通过点对点蒸馏实现鲁棒的领域随机化强化学习
机器学习
2020-12-10 v1
摘要
在强化学习中,领域随机化是一种日益流行的技术,用于学习对部署时领域偏移具有鲁棒性的更通用策略。然而,朴素地聚合来自随机化领域的信息可能导致梯度估计的高方差与不稳定的学习过程。为解决此问题,我们提出一种称为 P2PDRL 的强化学习点对点在线蒸馏策略,其中多个工作进程各自被分配至不同环境,并基于 Kullback-Leibler 散度通过互正则化交换知识。我们在连续控制任务上的实验表明,P2PDRL 能够在比基线更宽的随机化分布上实现鲁棒学习,并在测试时对新环境具有更鲁棒的泛化能力。
引用
@article{arxiv.2012.04839,
title = {Robust Domain Randomised Reinforcement Learning through Peer-to-Peer Distillation},
author = {Chenyang Zhao and Timothy Hospedales},
journal= {arXiv preprint arXiv:2012.04839},
year = {2020}
}