中文

基于不确定性引导的人类专家采样的离线机器人强化学习

机器学习 2022-12-19 v1 机器人学

摘要

批量(离线)强化学习的最新进展在利用可用离线数据学习方面显示出有前景的结果,并证明离线强化学习是在无模型设定下学习控制策略的重要工具包。将离线强化学习算法应用于由次优非学习类算法收集的数据集时,可得到优于用于收集数据的行为智能体的策略。这种情况在机器人领域很常见,现有自动化系统正在收集运行数据。尽管离线学习技术可以从次优行为智能体生成的数据中学习,但通过策略性地将人类示范数据引入训练过程,仍有机会改善现有离线强化学习算法的样本复杂度。为此,我们提出一种新方法,利用不确定性估计来触发人类示范数据的注入,并引导策略训练朝向最优行为,同时降低整体样本复杂度。我们的实验表明,与将专家数据与次优智能体收集的数据简单结合的朴素方法相比,该方法具有更高的样本效率。我们用所提方法增强了现有的离线强化学习算法Conservative Q-Learning,并在MuJoCo与OffWorld Gym学习环境收集的数据上进行了实验。

关键词

引用

@article{arxiv.2212.08232,
  title  = {Offline Robot Reinforcement Learning with Uncertainty-Guided Human Expert Sampling},
  author = {Ashish Kumar and Ilya Kuzovkin},
  journal= {arXiv preprint arXiv:2212.08232},
  year   = {2022}
}