以Realistic Actor-Critic平衡价值低估与高估
机器学习
2022-10-27 v6
摘要
无模型深度强化学习(RL)已成功应用于具有挑战性的连续控制领域。然而,较差的样本效率阻碍了这些方法在真实世界领域的广泛应用。本文提出一种新颖的无模型算法Realistic Actor-Critic(RAC),它可与任意离策略RL算法结合以提升样本效率。RAC采用通用值函数近似器(UVFA)以同一神经网络同时学习一个策略族,每个策略在低估与高估之间有不同权衡。为学习此类策略,我们引入不确定性惩罚Q学习,利用多个评论家集成的不确定性来构建Q函数的各种置信界。我们在MuJoCo基准上评估RAC,相较于SAC,在最具挑战性的Humanoid环境上实现了10倍样本效率与25%性能提升。
引用
@article{arxiv.2110.09712,
title = {Balancing Value Underestimation and Overestimation with Realistic Actor-Critic},
author = {Sicen Li and Qinyun Tang and Yiming Pang and Xinmeng Ma and Gang Wang},
journal= {arXiv preprint arXiv:2110.09712},
year = {2022}
}