分析经域随机化训练的深度强化学习智能体
机器学习
2022-10-26 v2 计算机视觉与模式识别
神经与进化计算
机器人学
摘要
深度强化学习有潜力训练机器人在真实世界中执行复杂任务,而无需机器人或其环境的精确模型。一种实用方法是在仿真中训练智能体,然后将其迁移到真实世界。实现可迁移性的一种流行方法是使用域随机化,即随机扰动模拟环境的各个方面,以使训练出的智能体对现实差距具有鲁棒性。然而,除任务性能外,针对部署在真实世界中的此类智能体的理解工作较少。在本文中,我们通过定性与定量比较经视觉域随机化和未经视觉域随机化训练的智能体来考察此类智能体。我们为 Fetch 和 Jaco 机器人在视觉运动控制任务上训练智能体,并评估它们在不同测试条件下的泛化能力。最后,我们使用一套可解释性技术考察训练后智能体的内部机制。我们的结果表明,域随机化的首要结果是更鲁棒、纠缠的表征,伴随具有更大空间结构的更大权重;此外,变化类型深受任务设置和额外本体感受输入存在的影响。另外,我们证明我们的域随机化智能体需要更高的样本复杂度,可能过拟合并更依赖循环处理。此外,即便使用了本文提出的改进显著性方法,我们表明定性研究未必与定量度量一致,需要结合多种检查工具才能对训练智能体的行为提供充分洞察。
引用
@article{arxiv.1912.08324,
title = {Analysing Deep Reinforcement Learning Agents Trained with Domain Randomisation},
author = {Tianhong Dai and Kai Arulkumaran and Tamara Gerbert and Samyakh Tukra and Feryal Behbahani and Anil Anthony Bharath},
journal= {arXiv preprint arXiv:1912.08324},
year = {2022}
}