中文

基于动态轨迹聚合的奖励塑形

机器学习 2021-04-14 v1 人工智能

摘要

强化学习通过获取最大化长期奖励的策略而受到积极研究。遗憾的是,这种学习类型在实际情况中过于缓慢且难以使用,因为真实环境中的状态-动作空间极为庞大。影响学习效率的本质因素是奖励。基于势函数的奖励塑形是一种丰富奖励的基本方法。该方法需要为每个领域定义一个称为势函数的特定实值函数。直接表示势函数通常较为困难。SARSA-RS 学习并获取势函数。然而,SARSA-RS 仅能应用于简单环境。该方法瓶颈在于对状态进行聚合以构建抽象状态,因为设计者几乎不可能为所有状态构建聚合函数。我们提出一种利用子目标序列的轨迹聚合方法。该方法在试错过程中仅借助子目标序列与子目标识别函数,对单幕中的状态进行动态聚合。它使设计者付出最小化,并使得应用于高维观测环境成为可能。我们通过参与者实验获取子目标序列。我们在三个领域进行了实验:四房间(离散状态与离散动作)、弹球(连续与离散)和抓取(均为连续)。我们将方法与基线强化学习算法及其他基于子目标的方法(包括随机子目标和朴素子目标奖励塑形)进行比较。结果表明,我们的奖励塑形在学习效率上优于所有其他方法。

关键词

引用

@article{arxiv.2104.06163,
  title  = {Reward Shaping with Dynamic Trajectory Aggregation},
  author = {Takato Okudo and Seiji Yamada},
  journal= {arXiv preprint arXiv:2104.06163},
  year   = {2021}
}

备注

accepted by The International Joint Conference on Neural Networks(IJCNN2021)