基于随机化奖励的模型基强化学习中的探索
机器学习
2023-01-10 v1 机器学习
摘要
模型基强化学习(MBRL)因其样本效率而被广泛采用。然而,现有最坏情况后悔分析通常要求乐观规划,而这一般在现实中并不合理。相反,受理论启发的实证研究利用模型集成,在各种测试环境中取得了最先进的性能。理论与实证研究之间的这种偏差使我们质疑:随机化模型集成是否能保证乐观性,从而保证最优的最坏情况后悔?本文从奖励随机化的视角部分回答了该问题,这是 MBRL 中极少被探索的探索方向。我们证明在核化线性调节器(KNR)模型下,奖励随机化保证部分乐观性,进而在交互次数上产生近最优的最坏情况后悔。我们进一步将理论推广到广义函数逼近,并给出了奖励随机化实现可证明高效探索的条件。相应地,我们提出了高效奖励随机化的具体实例。据我们所知,我们的分析建立了首个带函数逼近的随机化 MBRL 的最坏情况后悔分析。
引用
@article{arxiv.2301.03142,
title = {Exploration in Model-based Reinforcement Learning with Randomized Reward},
author = {Lingxiao Wang and Ping Li},
journal= {arXiv preprint arXiv:2301.03142},
year = {2023}
}