中文

$q$-门策尔强化学习

机器学习 2022-05-17 v1 人工智能

摘要

近来成功的门策尔强化学习(M-RL)通过用当前随机策略的对数增强奖励函数,实现了隐式 Kullback-Leibler(KL)正则化。尽管使用 Boltzmann softmax 策略已显示出显著改进,但当考虑 Tsallis sparsemax 策略时,该增强几乎对每一个所考虑的问题都导致平坦的学习曲线。我们表明,这是由于传统对数与 Tsallis 熵的非对数(广义)性质之间的不匹配。受 Tsallis 统计文献的启发,我们提出借助 qq-对数/指数函数来纠正 M-RL 的不匹配。所提出的公式在最大 Tsallis 熵框架下导出了隐式 Tsallis KL 正则化。我们表明这种 M-RL 公式再次在基准问题上取得了优越性能,并为具有各种熵指数 qq 的更一般 M-RL 提供了启示。

关键词

引用

@article{arxiv.2205.07467,
  title  = {$q$-Munchausen Reinforcement Learning},
  author = {Lingwei Zhu and Zheng Chen and Eiji Uchibe and Takamitsu Matsubara},
  journal= {arXiv preprint arXiv:2205.07467},
  year   = {2022}
}