中文

用于强化学习的 Choquet 正则化

机器学习 2022-08-19 v1 机器学习 数理金融

摘要

我们提出 \emph{Choquet 正则化子} 来度量和管理强化学习(RL)的探索水平,并重新表述了 Wang 等人(2020, JMLR, 21(198))的连续时间熵正则化 RL 问题,其中我们将用于正则化的微分熵替换为 Choquet 正则化子。我们推导了该问题的 Hamilton--Jacobi--Bellman 方程,并在线性--二次(LQ)情形下通过静态最大化一个均值--方差约束的 Choquet 正则化子显式求解。在 LQ 设定下,我们推导了若干特定 Choquet 正则化子的显式最优分布,并反过来识别了生成若干广泛使用的探索采样器(如 ϵ\epsilon-greedy、指数、均匀与高斯)的 Choquet 正则化子。

关键词

引用

@article{arxiv.2208.08497,
  title  = {Choquet regularization for reinforcement learning},
  author = {Xia Han and Ruodu Wang and Xun Yu Zhou},
  journal= {arXiv preprint arXiv:2208.08497},
  year   = {2022}
}