中文

面向 Soft Actor-Critic 的加权熵修改

机器学习 2020-11-19 v1 机器人学

摘要

我们将强化学习(RL)中现有的最大Shannon熵原理推广至加权熵,通过赋予状态-动作对某些定性权重来进行表征,这些权重可与先验知识、经验回放以及策略的演化过程相关联。我们提出了一种以引入的权重函数为动机、旨在实现自平衡探索的算法,尽管其实现简单,但在 Mujoco 任务上取得了SOTA的性能。

关键词

引用

@article{arxiv.2011.09083,
  title  = {Weighted Entropy Modification for Soft Actor-Critic},
  author = {Yizhou Zhao and Song-Chun Zhu},
  journal= {arXiv preprint arXiv:2011.09083},
  year   = {2020}
}