面向 Soft Actor-Critic 的加权熵修改
机器学习
2020-11-19 v1 机器人学
摘要
我们将强化学习(RL)中现有的最大Shannon熵原理推广至加权熵,通过赋予状态-动作对某些定性权重来进行表征,这些权重可与先验知识、经验回放以及策略的演化过程相关联。我们提出了一种以引入的权重函数为动机、旨在实现自平衡探索的算法,尽管其实现简单,但在 Mujoco 任务上取得了SOTA的性能。
引用
@article{arxiv.2011.09083,
title = {Weighted Entropy Modification for Soft Actor-Critic},
author = {Yizhou Zhao and Song-Chun Zhu},
journal= {arXiv preprint arXiv:2011.09083},
year = {2020}
}