中文

一种用于强化学习智能体的基于势的新奖励塑形方法

人工智能 2023-03-15 v3 机器学习

摘要

基于势的奖励塑形(PBRS)是一类特定的机器学习方法,旨在通过在执行任务时提取并利用额外知识来提高强化学习智能体的学习速度。迁移学习过程包含两步:从先前学习任务中提取知识,并将该知识迁移以用于目标任务。后一步在文献中已有充分讨论并提出了多种方法,而前一步探索较少。鉴于此,所传输知识的类型十分重要,并可带来显著改进。在迁移学习与基于势的奖励塑形的文献中,从未被探讨过的一个主题是学习过程本身所积累的知识。本文中,我们提出一种新颖的基于势的奖励塑形方法,试图从学习过程中提取知识。所提方法从回合的累积奖励中提取知识。该方法在街机学习环境(Arcade learning environment)中进行了评估,结果表明其在单任务与多任务强化学习智能体中均改善了学习过程。

关键词

引用

@article{arxiv.1902.06239,
  title  = {A new Potential-Based Reward Shaping for Reinforcement Learning Agent},
  author = {Babak Badnava and Mona Esmaeili and Nasser Mozayani and Payman Zarkesh-Ha},
  journal= {arXiv preprint arXiv:1902.06239},
  year   = {2023}
}