基于类比解耦探索的离策略深度强化学习
机器学习
2020-03-02 v2 机器学习
摘要
离策略强化学习(RL)关注于通过执行另一个收集经验样本的策略来学习一个高回报策略。前者(即目标策略)高回报但缺乏表现力(多数情况下为确定性),相反,做好后者任务需要一个提供有引导且高效探索的表现力策略(即行为策略)。与大多数在最优性与表现力之间权衡的方法不同,解耦框架显式地将两个目标分离,各自由不同的独立策略处理。尽管能够针对自身目标自由设计和优化两个策略,朴素解耦可能导致低效学习或稳定性问题。为缓解该问题,我们提出的方法Analogous Disentangled Actor-Critic(ADAC)设计了类比的 actor 与 critic 对。具体而言,ADAC 利用关于 Stein 变分梯度下降(SVGD)的一个关键性质,以目标策略为约束限制表现力基于能量的行为策略以实现有效探索。此外,引入类比 critic 对以原则性方式融入内在奖励,并在整体学习稳定性与有效性上提供理论保证。我们在14个连续控制任务上经验评估仅使用环境奖励的ADAC,并在其中10个上报告了最优结果。我们进一步展示,当ADAC与内在奖励结合时,在探索困难任务上优于其他替代方法。
引用
@article{arxiv.2002.10738,
title = {Off-Policy Deep Reinforcement Learning with Analogous Disentangled Exploration},
author = {Anji Liu and Yitao Liang and Guy Van den Broeck},
journal= {arXiv preprint arXiv:2002.10738},
year = {2020}
}
备注
In Proc. of the 19th International Conference on Autonomous Agents and Multiagent Systems, IFAAMAS 2020