EAGER:语言引导强化学习中用于自动奖励塑形的问答机制
计算与语言
2022-10-14 v4 人工智能
机器学习
摘要
在长时序与稀疏奖励任务中,强化学习(RL) notoriously 困难且需要大量训练步。加速该过程的标准方案是利用额外奖励信号,对其塑形以更好地引导学习过程。在语言条件 RL 背景下,语言输入的抽象与泛化特性为更高效的奖励塑形方式提供了机会。本文利用该思路,提出一种自动奖励塑形方法:智能体从通用语言目标中提取辅助目标。这些辅助目标使用问题生成(QG)与问答(QA)系统:其由若干问题构成,引导智能体尝试利用自身轨迹重建关于全局目标的部分信息。当其成功时,会获得与回答置信度成比例的内在奖励。这激励智能体生成能明确解释通用语言目标各方面的轨迹。我们的实验研究表明,该方法无需工程师干预设计辅助目标,并通过有效引导探索提升了样本效率。
引用
@article{arxiv.2206.09674,
title = {EAGER: Asking and Answering Questions for Automatic Reward Shaping in Language-guided RL},
author = {Thomas Carta and Pierre-Yves Oudeyer and Olivier Sigaud and Sylvain Lamprier},
journal= {arXiv preprint arXiv:2206.09674},
year = {2022}
}
备注
24 pages, 16 figures, 5 tables