DAC:用于学习选项的双重 actor-critic 架构
机器学习
2019-09-12 v7 人工智能
机器学习
摘要
我们将选项框架重新表述为两个并行的增广MDP。在此新表述下,所有策略优化算法均可开箱即用,用于学习选项内策略、选项终止条件以及选项上的主策略。我们在每个增广MDP上应用actor-critic算法,得到双重Actor-Critic(DAC)架构。此外,我们表明,当使用状态值函数作为评论家时,一个评论家可用另一个表示,因此仅需一个评论家。我们在具挑战性的机器人仿真任务上进行了实证研究。在迁移学习设定下,DAC优于其无层次对应方法以及先前基于梯度的选项学习算法。
引用
@article{arxiv.1904.12691,
title = {DAC: The Double Actor-Critic Architecture for Learning Options},
author = {Shangtong Zhang and Shimon Whiteson},
journal= {arXiv preprint arXiv:1904.12691},
year = {2019}
}
备注
NeurIPS 2019