中文

强化学习中的最大熵模型校正

机器学习 2023-11-30 v1 人工智能 系统与控制 系统与控制 最优化与控制 机器学习

摘要

我们提出并从理论上分析了一种在强化学习中使用近似模型进行规划的方法,该方法可减轻模型误差的不利影响。若模型足够准确,它还能加速收敛到真实值函数。其关键组成部分之一是基于最大熵密度估计公式的 MaxEnt 模型校正(MoCo)过程,用于校正模型的下一状态分布。基于 MoCo,我们引入了模型校正值迭代(MoCoVI)算法及其基于采样的变体 MoCoDyna。我们表明 MoCoVI 与 MoCoDyna 的收敛速度可比传统的无模型算法快得多。与传统基于模型的算法不同,MoCoVI 和 MoCoDyna 有效利用近似模型,仍能收敛到正确的值函数。

关键词

引用

@article{arxiv.2311.17855,
  title  = {Maximum Entropy Model Correction in Reinforcement Learning},
  author = {Amin Rakhsha and Mete Kemertas and Mohammad Ghavamzadeh and Amir-massoud Farahmand},
  journal= {arXiv preprint arXiv:2311.17855},
  year   = {2023}
}