对抗引导的 Actor-Critic
机器学习
2021-02-09 v1 人工智能
机器学习
摘要
尽管在深度强化学习问题中取得了明确成功,actor-critic 算法在复杂环境中仍面临样本效率低的问题,特别是在高效探索成为瓶颈的任务中。这些方法考虑一个策略(actor)和一个值函数(critic),它们各自的损失是使用不同的动机和方法构建的。本文引入第三个角色:对抗者(adversary)。对抗者通过最小化其动作分布与 actor 之间的 KL 散度来模仿 actor,而 actor 除了学习解决任务外,还试图使自己与对抗者的预测区分开来。这一新颖目标刺激 actor 遵循无法从先前轨迹中正确预测的策略,使其在奖励极其稀疏的任务中表现出创新性。我们的实验分析表明,所得到的对抗引导的 Actor-Critic(AGAC)算法带来了更充分的探索。值得注意的是,AGAC 在一组各种难探索且程序生成的任务上优于当前最先进的方法。
引用
@article{arxiv.2102.04376,
title = {Adversarially Guided Actor-Critic},
author = {Yannis Flet-Berliac and Johan Ferret and Olivier Pietquin and Philippe Preux and Matthieu Geist},
journal= {arXiv preprint arXiv:2102.04376},
year = {2021}
}
备注
Accepted at ICLR 2021