SOAC:软选项演员-评论家架构
人工智能
2020-06-26 v1 机器学习
摘要
选项框架通过从长时域任务中自动提取时间扩展的子任务已展现出巨大前景。已有方法被提出用于同时学习底层选项内策略和高层选项选择策略。然而,现有方法通常面临两大主要挑战:探索效率低和更新不稳定。本文提出一种新颖且稳定的离策略方法,该方法基于最大熵模型以应对这些挑战。我们的方法引入了一种信息论内在奖励,以鼓励识别多样且有效的选项。同时,我们利用概率推断模型将优化问题简化为拟合最优轨迹。实验结果表明,在一系列 Mujoco 基准任务中,我们的方法显著优于先前的同策略和离策略方法,同时仍对迁移学习提供益处。在这些任务中,我们的方法学习到一组多样的选项,其中每个选项的状态-动作空间都具有强相干性。
引用
@article{arxiv.2006.14363,
title = {SOAC: The Soft Option Actor-Critic Architecture},
author = {Chenghao Li and Xiaoteng Ma and Chongjie Zhang and Jun Yang and Li Xia and Qianchuan Zhao},
journal= {arXiv preprint arXiv:2006.14363},
year = {2020}
}