基于凸风险最小化的离环境评估
机器人学
2021-12-23 v1 机器学习
摘要
在机器人上应用强化学习 (RL) 方法通常涉及在仿真中训练策略并将其部署到真实世界中的机器人上。由于真实世界与仿真器之间的模型失配,以这种方式部署的 RL 智能体往往表现次优。为解决此问题,研究者已开发了依赖合成噪声扰动的鲁棒策略学习算法。然而,此类方法不保证在目标环境中的性能。我们提出一种凸风险最小化算法,利用来自两个环境的轨迹数据估计仿真器与目标域之间的模型失配。我们表明该估计器可与仿真器一同用于评估 RL 智能体在目标域中的性能,有效弥合这两个环境之间的差距。我们还表明我们的估计器的收敛速率为 阶,其中 为训练样本数。在仿真中,我们展示了我们的方法如何在 Gridworld、Cartpole 和 Reacher 环境上对各种策略有效地近似和评估性能。我们还展示了我们的方法能够利用仿真器以及从真实世界中机器人远程收集的数据来估计一个 7 DOF 机械臂的性能。
引用
@article{arxiv.2112.11532,
title = {Off Environment Evaluation Using Convex Risk Minimization},
author = {Pulkit Katdare and Shuijing Liu and Katherine Driggs-Campbell},
journal= {arXiv preprint arXiv:2112.11532},
year = {2021}
}
备注
7 pages, 3 figures (with sub-figures)