用前向-后向强化学习求解推箱子问题
机器学习
2021-05-25 v2 人工智能
摘要
尽管近年来强化学习取得开创性进展,许多奖励稀疏(例如仅在任务完成时给予)的领域仍极具挑战性。此类情况下,从任务起点和终点双向推进并使两端汇合可能有益。然而,现有此类方法在临近终点的策略与前期有效策略差异很大的常见场景中效果不佳。本工作针对此类设定提出一种新颖的RL方法。简言之,我们首先以简单的松弛目标训练一个后向智能体,随后用直观的提示特征增强前向智能体的状态表示。这使得学习到的前向智能体可利用来自后向规划的信息,而无需模仿其策略。我们在具有挑战性的推箱子(Sokoban)游戏上展示了方法的有效性,大幅超越可跨关卡泛化的学习求解器,并与最佳精工系统的最先进(SOTA)性能相竞争。令人印象深刻的是,我们在仅从少量练习关卡学习并使用简单RL技术的情况下取得了这些结果。
引用
@article{arxiv.2105.01904,
title = {Solving Sokoban with forward-backward reinforcement learning},
author = {Yaron Shoham and Gal Elidan},
journal= {arXiv preprint arXiv:2105.01904},
year = {2021}
}
备注
To be published in SoCS 2021