一种用于强化学习的最大最小熵框架
机器学习
2021-12-21 v3 人工智能
摘要
本文提出一种用于强化学习(RL)的最大最小熵框架,以克服在基于模型无关采样的学习中实现最大熵 RL 的软 actor-critic(SAC)算法的局限。最大熵 RL 引导策略学习以在未来到达高熵状态,而所提出的最大最小熵框架旨在学习访问低熵状态并最大化这些低熵状态的熵,从而促进更好的探索。对于一般的马尔可夫决策过程(MDPs),基于探索与利用的解耦,在该最大最小熵框架下构建了高效算法。数值结果表明,所提算法相较当前最先进的 RL 算法取得了显著的性能提升。
引用
@article{arxiv.2106.10517,
title = {A Max-Min Entropy Framework for Reinforcement Learning},
author = {Seungyul Han and Youngchul Sung},
journal= {arXiv preprint arXiv:2106.10517},
year = {2021}
}
备注
Accepted to NeurIPS 2021