OPAC:机会式 Actor-Critic
机器学习
2020-12-14 v1 人工智能
摘要
Actor-critic 方法作为一种无模型强化学习(RL),已在连续控制的许多真实领域取得最先进的性能。尽管取得成功,这些模型的广泛部署仍遥不可及。这些 actor-critic 方法的主要问题在于低效探索与次优策略。Soft Actor-Critic(SAC)与 Twin Delayed Deep Deterministic Policy Gradient(TD3)这两种前沿算法均受此类问题困扰。SAC 有效解决了样本复杂度与对超参数收敛脆弱性的问题,从而在更难任务中超越包括 TD3 在内的所有最先进算法,而 TD3 在所有环境中仅取得中等结果。SAC 因其策略的高斯特性导致探索低效,在较简单任务中表现勉强。本文提出 Opportunistic Actor-Critic(OPAC),一种采用更好探索策略与更小方差的新型无模型深度 RL 算法。OPAC 结合了 TD3 与 SAC 若干最强大的特性,旨在以离策略方式优化随机策略。为计算目标 Q 值,OPAC 使用三个而非两个 critic,并基于环境复杂度机会式地选择如何从 critic 的评估中计算目标 Q 值。我们在 MuJoCo 环境上系统评估了该算法,其取得了最先进的性能,并优于或至少持平 TD3 与 SAC。
引用
@article{arxiv.2012.06555,
title = {OPAC: Opportunistic Actor-Critic},
author = {Srinjoy Roy and Saptam Bakshi and Tamal Maharaj},
journal= {arXiv preprint arXiv:2012.06555},
year = {2020}
}
备注
10 pages. arXiv admin note: text overlap with arXiv:1812.05905 by other authors