中文

Align-RUDDER:通过奖励重分配从少量演示中学习

机器学习 2022-06-30 v2 人工智能 机器学习

摘要

强化学习算法在求解具有稀疏且延迟奖励的复杂分层任务时需要大量样本。对于此类复杂任务,近期提出的 RUDDER 利用奖励重分配来利用 Q 函数中与完成子任务相关的步骤。然而,由于当前的探索策略无法在合理时间内发现高奖励片段,通常只有少量高奖励的片段可作为演示可用。本工作中,我们引入 Align-RUDDER,其利用从演示的多重序列比对中获得的奖励重分配轮廓模型。因此,Align-RUDDER 有效地运用了奖励重分配,从而大幅改进了在少量演示上的学习。Align-RUDDER 在具有延迟奖励与少量演示的复杂人工任务上优于竞争对手。在 Minecraft ObtainDiamond 任务上,Align-RUDDER 能够开采到钻石,尽管并不频繁。代码见 https://github.com/ml-jku/align-rudder。YouTube: https://youtu.be/HO-_8ZUl-UY

关键词

引用

@article{arxiv.2009.14108,
  title  = {Align-RUDDER: Learning From Few Demonstrations by Reward Redistribution},
  author = {Vihang P. Patil and Markus Hofmarcher and Marius-Constantin Dinu and Matthias Dorfer and Patrick M. Blies and Johannes Brandstetter and Jose A. Arjona-Medina and Sepp Hochreiter},
  journal= {arXiv preprint arXiv:2009.14108},
  year   = {2022}
}

备注

Github: https://github.com/ml-jku/align-rudder, YouTube: https://youtu.be/HO-_8ZUl-UY