中文

MCAC:基于蒙特卡洛增强的演员-评论家算法用于次优演示下的稀疏奖励深度强化学习

机器学习 2022-10-24 v2 人工智能

摘要

为强化学习(RL)算法提供稠密塑形奖励函数通常极具挑战性,这推动了能够从更易指定的稀疏奖励函数中学习的 RL 算法的发展。这种稀疏性带来了新的探索难题。解决该问题的一种常见方法是利用演示来提供关于状态空间中高奖励区域的初始信号。然而,先前的从演示中学习的 RL 算法引入了显著的复杂性和众多超参数,难以实现和调优。我们提出蒙特卡洛增强演员评论家(MCAC),这是对标准演员-评论家算法的无参数修改,它将演示填入回放缓冲区,并通过取标准时间差分(TD)目标与奖励-to-go 的蒙特卡洛估计的最大值来计算修正的 QQ 值。这通过提升相应状态空间区域的高 QQ 值,鼓励在高性能轨迹邻域内进行探索。在 55 个连续控制域上的实验表明,MCAC 可显著增强 66 种常用 RL 及从演示中 RL 算法的学习效率。代码与补充材料见 https://sites.google.com/view/mcac-rl。

关键词

引用

@article{arxiv.2210.07432,
  title  = {Monte Carlo Augmented Actor-Critic for Sparse Reward Deep Reinforcement Learning from Suboptimal Demonstrations},
  author = {Albert Wilcox and Ashwin Balakrishna and Jules Dedieu and Wyame Benslimane and Daniel S. Brown and Ken Goldberg},
  journal= {arXiv preprint arXiv:2210.07432},
  year   = {2022}
}

备注

To be published in the 36th Conference on Neural Information Processing Systems (NeurIPS 2022). 19 pages. 11 figures