中文

基于双演员与正则化评论家的高效连续控制

机器学习 2021-06-08 v1

摘要

如何获得良好的价值估计是强化学习(RL)中的关键问题之一。当前的价值估计方法,如DDPG和TD3,受到不必要的过估计或欠估计偏差的困扰。在本文中,我们探索了长期被忽视的双演员(double actors)在连续设定下实现更好价值函数估计的潜力。首先,我们通过在单评论家与双评论家上构建双演员,分别处理DDPG中的过估计偏差与TD3中的欠估计偏差,揭示并证明了双演员的偏差缓解特性。接着,我们有趣地发现双演员有助于提升智能体的探索能力。最后,为缓解双评论家价值估计的不确定性,我们进一步提出在双演员架构下对评论家网络进行正则化,由此产生双演员正则化评论家(DARC)算法。在具挑战性的连续控制任务上的大量实验结果表明,DARC以更高的样本效率显著优于最先进的方法。

关键词

引用

@article{arxiv.2106.03050,
  title  = {Efficient Continuous Control with Double Actors and Regularized Critics},
  author = {Jiafei Lyu and Xiaoteng Ma and Jiangpeng Yan and Xiu Li},
  journal= {arXiv preprint arXiv:2106.03050},
  year   = {2021}
}

备注

21 pages