用于离环境策略评估的边缘化重要性采样
机器学习
2023-10-06 v2 人工智能
机器人学
摘要
强化学习(RL)方法通常样本效率低下,使得在真实世界机器人中训练和部署RL策略具有挑战性。即便是仿真中训练的鲁棒策略也需要真实世界部署来评估其性能。本文提出一种在真实世界部署前评估智能体策略真实世界性能的新方法。我们的方法结合模拟器与真实世界离线数据,利用边缘化重要性采样(MIS)框架评估任意策略的性能。现有MIS方法面临两个挑战:(1)偏离合理范围的大密度比与(2)间接监督,即密度比需间接推断,从而加剧估计误差。我们的方法通过引入模拟器中目标策略的占用率作为中间变量,并将密度比学习为可分别学习的两项之积,应对这些挑战。第一项以直接监督学习,第二项量级较小,从而计算高效。我们分析了两步流程的样本复杂度和误差传播。此外,我们在Cartpole、Reacher和Half-Cheetah等Sim2Sim环境上实证评估了我们的方法。结果显示我们的方法在多种Sim2Sim差距、目标策略和离线数据收集策略上均良好泛化。我们还在一项Sim2Real任务上展示了算法性能:使用离线数据与Gazebo模拟器验证7自由度机械臂的性能。
引用
@article{arxiv.2309.01807,
title = {Marginalized Importance Sampling for Off-Environment Policy Evaluation},
author = {Pulkit Katdare and Nan Jiang and Katherine Driggs-Campbell},
journal= {arXiv preprint arXiv:2309.01807},
year = {2023}
}