中文

推箱子游戏中的基于势函数的奖励塑形

机器学习 2021-09-14 v1 人工智能

摘要

学习解决稀疏奖励的强化学习问题是困难的,因为缺乏朝向目标的引导。但在某些问题中,可以利用先验知识来增强学习过程。奖励塑形是一种将先验知识融入原始奖励函数以加速学习的方法。虽然先前的工作研究了利用专家知识生成势函数,但在本工作中,我们研究是否可以使用搜索算法(A*)在著名的规划任务推箱子(Sokoban)中自动生成用于奖励塑形的势函数。结果表明,使用塑形奖励函数学习比从零开始学习更快。我们的结果表明距离函数可能是推箱子合适的函数。本工作展示了在奖励塑形帮助下解决多个实例的可能性。结果可以压缩为单一策略,这可视为训练能够解决未见实例的通用策略的第一步。

关键词

引用

@article{arxiv.2109.05022,
  title  = {Potential-based Reward Shaping in Sokoban},
  author = {Zhao Yang and Mike Preuss and Aske Plaat},
  journal= {arXiv preprint arXiv:2109.05022},
  year   = {2021}
}