中文

基于模型的强化学习中的动态时域价值估计

机器学习 2020-09-22 v1 人工智能

摘要

现有的基于模型的价值扩展方法通常利用世界模型以固定展开时域进行价值估计,以辅助策略学习。然而,使用不准确模型的固定展开有可能损害学习过程。本文中,我们研究利用模型知识自适应地进行价值扩展的思路。我们提出一种称为动态时域基于模型的价值扩展(DMVE)的新方法,以通过不同展开时域调整世界模型的使用。受可应用于视觉数据新颖性检测的基于重构技术的启发,我们利用带重构模块的世界模型进行图像特征提取,以获得更精确的价值估计。原始图像与重构图像均用于确定自适应价值扩展的合适时域。在若干基准视觉控制任务上,实验结果表明DMVE在样本效率与最终性能上优于所有基线,表明DMVE能比最先进的基于模型方法实现更有效且准确的价值估计。

关键词

引用

@article{arxiv.2009.09593,
  title  = {Dynamic Horizon Value Estimation for Model-based Reinforcement Learning},
  author = {Junjie Wang and Qichao Zhang and Dongbin Zhao and Mengchen Zhao and Jianye Hao},
  journal= {arXiv preprint arXiv:2009.09593},
  year   = {2020}
}

备注

9 pages, 6 figures