中文

利用不准确模拟器提高离线强化学习

机器人学 2024-05-08 v1 人工智能 机器学习

摘要

离线强化学习(RL)提供了一种避免与真实环境进行昂贵交互的 promising 方法。然而,离线 RL 的性能高度依赖于数据集的质量,这可能在学习过程中导致外推误差。 在许多机器人应用中,常常可用到不准确的模拟器。然而,无法直接将来自不准确模拟器的数据用于离线 RL,因为存在所谓的探索-开发平衡难题以及不准确模拟与真实环境之间的动态差距。为解决这些问题,我们提出了一种更好地结合离线数据集和不准确模拟器数据的新方法。具体而言,我们预训练一个生成对抗网络(GAN)模型以拟合离线数据集的状态分布。基于此,我们从生成器提供的分布开始收集来自不准确模拟器的数据,并通过判别器对模拟数据进行重新加权。我们的实验结果在 D4RL 基准和真实世界的操控任务中均确认,我们的方法能够从不准确的模拟器和有限的离线数据集中获得更好的性能,优于当前最先进的方法。

关键词

引用

@article{arxiv.2405.04307,
  title  = {Improving Offline Reinforcement Learning with Inaccurate Simulators},
  author = {Yiwen Hou and Haoyuan Sun and Jinming Ma and Feng Wu},
  journal= {arXiv preprint arXiv:2405.04307},
  year   = {2024}
}