中文

EAGER:语言引导强化学习中用于自动奖励塑形的问答机制

计算与语言 2022-10-14 v4 人工智能 机器学习

摘要

在长时序与稀疏奖励任务中,强化学习(RL) notoriously 困难且需要大量训练步。加速该过程的标准方案是利用额外奖励信号,对其塑形以更好地引导学习过程。在语言条件 RL 背景下,语言输入的抽象与泛化特性为更高效的奖励塑形方式提供了机会。本文利用该思路,提出一种自动奖励塑形方法:智能体从通用语言目标中提取辅助目标。这些辅助目标使用问题生成(QG)与问答(QA)系统:其由若干问题构成,引导智能体尝试利用自身轨迹重建关于全局目标的部分信息。当其成功时,会获得与回答置信度成比例的内在奖励。这激励智能体生成能明确解释通用语言目标各方面的轨迹。我们的实验研究表明,该方法无需工程师干预设计辅助目标,并通过有效引导探索提升了样本效率。

关键词

引用

@article{arxiv.2206.09674,
  title  = {EAGER: Asking and Answering Questions for Automatic Reward Shaping in Language-guided RL},
  author = {Thomas Carta and Pierre-Yves Oudeyer and Olivier Sigaud and Sylvain Lamprier},
  journal= {arXiv preprint arXiv:2206.09674},
  year   = {2022}
}

备注

24 pages, 16 figures, 5 tables