蒸馏域随机化
机器学习
2021-12-07 v1 机器人学
摘要
深度强化学习是从零开始学习机器人控制策略的有效工具。然而,这些方法因所需训练数据量巨大而声名狼藉,在真实机器人上收集这些数据成本高昂得令人望而却步。一个极受欢迎的替代方案是从模拟中学习,从而更快、更安全、更廉价地生成数据。由于所有模拟器都只是对现实的模型,模拟数据与现实数据之间存在不可避免的差异,常被称为“现实差距”。为弥合这一差距,许多方法从一个模拟器分布中学习单一策略。本文中,我们提出将基于随机物理模拟的强化学习与策略蒸馏相结合。我们的算法称为蒸馏域随机化(Distilled Domain Randomization, DiDoR),它将最初采样的域上的专家即所谓教师策略蒸馏为一个随后部署的学生策略。以此方式,DiDoR 学习直接从模拟迁移到现实的控制器,即无需来自目标域的数据。我们在三个模拟到模拟以及两个模拟到现实的实验中将 DiDoR 与三种基线进行比较。我们的结果表明,用 DiDoR 训练的策略的目标域性能与基线相当或优于基线。此外,我们的方法既不增加所需存储容量也不增加计算动作的时间,而这可能是成功部署所学控制器的失败点。
引用
@article{arxiv.2112.03149,
title = {Distilled Domain Randomization},
author = {Julien Brosseit and Benedikt Hahner and Fabio Muratore and Michael Gienger and Jan Peters},
journal= {arXiv preprint arXiv:2112.03149},
year = {2021}
}
备注
shared first authorship between Julien Brosseit, Benedikt Hahner, and Fabio Muratore