Backplay:"Man muss immer umkehren"
机器学习
2022-04-22 v5 人工智能
机器学习
摘要
无模型强化学习(RL)需要大量试验来学习良好的策略,尤其是在具有稀疏奖励的环境中。我们探索了一种在能够获取演示数据时可提高样本效率的方法。我们的方法Backplay使用单个演示为给定任务构建课程。我们不是在每个训练回合中从环境的固定初始状态开始,而是从演示末尾附近启动智能体,并在训练过程中将起点向后移动,直到到达初始状态。我们的贡献在于:解析刻画了Backplay可提升训练速度的环境类型,在大型网格世界和复杂的四玩家零和博弈(Pommerman)中证明了Backplay的有效性,并表明Backplay优于其他已知的提高样本效率的竞争性方法。这包括奖励塑形、行为克隆和反向课程生成。
引用
@article{arxiv.1807.06919,
title = {Backplay: "Man muss immer umkehren"},
author = {Cinjon Resnick and Roberta Raileanu and Sanyam Kapoor and Alexander Peysakhovich and Kyunghyun Cho and Joan Bruna},
journal= {arXiv preprint arXiv:1807.06919},
year = {2022}
}
备注
AAAI-19 Workshop on Reinforcement Learning in Games; 0xd1a80a702b8170f6abeaabcf32a0c4c4401e9177