中文

面向基于模型的离线强化学习的环境Transformer与策略优化

机器学习 2023-10-17 v2 人工智能

摘要

在机器人任务中,与实际环境交互以获取数据通常成本高昂且耗时。基于模型的离线强化学习(RL)提供了一种可行的解决方案。一方面,它消除了与实际环境交互的需求。另一方面,它从离线数据集中学习转移动态与奖励函数,并生成模拟展开以加速训练。以往的基于模型的离线RL方法采用概率集成神经网络(NN)来建模偶然不确定性与认知不确定性。然而,这导致训练时间与计算资源需求呈指数级增长。此外,这些方法在模拟长期展开时容易受到环境动态模型累积误差的干扰。为解决上述问题,我们提出了一种称为Environment Transformer的不确定性感知序列建模架构。它对环境动态与奖励函数的概率分布进行建模以捕捉偶然不确定性,并将认知不确定性视为可学习的噪声参数。得益于对转移动态与奖励函数的精确建模,Environment Transformer可与任意规划、动态规划或策略优化算法结合用于离线RL。在此情形下,我们采用Conservative Q-Learning(CQL)来学习保守的Q函数。通过仿真实验,我们证明了我们的方法在广泛研究的离线RL基准上达到或超越了最先进的性能。此外,我们表明Environment Transformer的模拟展开质量、样本效率与长期展开模拟能力均优于以往的基于模型的离线RL方法。

关键词

引用

@article{arxiv.2303.03811,
  title  = {Environment Transformer and Policy Optimization for Model-Based Offline Reinforcement Learning},
  author = {Pengqin Wang and Meixin Zhu and Shaojie Shen},
  journal= {arXiv preprint arXiv:2303.03811},
  year   = {2023}
}

备注

ICRA2024