中文

用于强化学习奖励塑形的时序视频-语言对齐网络

机器人学 2023-02-09 v1

摘要

为强化学习(RL)方法设计恰当的奖励函数一直是个重要问题,尤其是对于 Atari 游戏等复杂环境。利用自然语言指令在称为奖励塑形的过程中为 RL 智能体提供中间奖励,可帮助智能体更快地到达目标状态。在本工作中,我们提出一种基于自然语言的奖励塑形方法,使用 LanguagE-Action Reward Network(LEARN)框架的扩展,将 Montezuma's Revenge 游戏环境中的轨迹映射到相应的自然语言指令。这些轨迹-语言映射进一步用于生成中间奖励,这些奖励被整合进奖励函数,可用于为任何标准 RL 算法学习最优策略。对于来自 Atari 的 Montezuma's Revenge 游戏的 15 个任务集合,Ext-LEARN 方法比使用 LEARN 框架的奖励塑形方法更频繁地成功完成任务,甚至优于无基于自然语言奖励的奖励塑形框架。

关键词

引用

@article{arxiv.2302.03954,
  title  = {Temporal Video-Language Alignment Network for Reward Shaping in Reinforcement Learning},
  author = {Ziyuan Cao and Reshma Anugundanahalli Ramachandra and Kelin Yu},
  journal= {arXiv preprint arXiv:2302.03954},
  year   = {2023}
}