中文

基于模型的强化学习中的模型优势与值感知模型:弥合理论与实践的鸿沟

机器学习 2022-01-31 v2 人工智能 机器学习

摘要

本工作表明,以诸多理论优势著称的值感知模型学习,在主流的基于模型的强化学习算法中对于求解具有挑战性的连续控制任务同样切实可行。首先,我们通过界定给定固定策略下两个 MDP 或模型之间的模型优势(即模型性能差异)推导出一种新颖的值感知模型学习目标,在多数连续控制环境中取得了优于先前值感知目标的性能。其次,我们识别出在 dyna 风格基于模型的 RL 算法中朴素地以值感知目标替代最大似然时所存在的价值估计陈旧问题。我们针对该问题提出的补救方法,通过使所有值感知目标能成功部署于求解若干连续控制机器人操纵与运动任务,弥合了值感知模型学习中长期存在的理论与实践鸿沟。我们的结果仅对两种流行且开源的基于模型的 RL 算法——SLBO 与 MBPO——做了极小修改,未调优任何现有超参数,同时在某些环境中也展示了值感知目标优于这些基线。

关键词

引用

@article{arxiv.2106.14080,
  title  = {Model-Advantage and Value-Aware Models for Model-Based Reinforcement Learning: Bridging the Gap in Theory and Practice},
  author = {Nirbhay Modhe and Harish Kamath and Dhruv Batra and Ashwin Kalyan},
  journal= {arXiv preprint arXiv:2106.14080},
  year   = {2022}
}