中文

对抗引导的 Actor-Critic

机器学习 2021-02-09 v1 人工智能 机器学习

摘要

尽管在深度强化学习问题中取得了明确成功,actor-critic 算法在复杂环境中仍面临样本效率低的问题,特别是在高效探索成为瓶颈的任务中。这些方法考虑一个策略(actor)和一个值函数(critic),它们各自的损失是使用不同的动机和方法构建的。本文引入第三个角色:对抗者(adversary)。对抗者通过最小化其动作分布与 actor 之间的 KL 散度来模仿 actor,而 actor 除了学习解决任务外,还试图使自己与对抗者的预测区分开来。这一新颖目标刺激 actor 遵循无法从先前轨迹中正确预测的策略,使其在奖励极其稀疏的任务中表现出创新性。我们的实验分析表明,所得到的对抗引导的 Actor-Critic(AGAC)算法带来了更充分的探索。值得注意的是,AGAC 在一组各种难探索且程序生成的任务上优于当前最先进的方法。

关键词

引用

@article{arxiv.2102.04376,
  title  = {Adversarially Guided Actor-Critic},
  author = {Yannis Flet-Berliac and Johan Ferret and Olivier Pietquin and Philippe Preux and Matthieu Geist},
  journal= {arXiv preprint arXiv:2102.04376},
  year   = {2021}
}

备注

Accepted at ICLR 2021