中文

Int-HRL:迈向基于意图的分层强化学习

机器学习 2023-06-21 v1

摘要

尽管深度强化学习 (RL) 智能体在越来越多的任务上超越了人类,但训练它们需要相当于数十年人类游戏的数据量。近期的分层 RL 方法通过纳入决策问题结构所固有的信息提高了样本效率,但代价是需要发现或使用人类标注的子目标来引导学习过程。我们表明,人类玩家的意图,即目标导向决策的前体,即使对于 Montezuma's Revenge 这一 Atari2600 游戏套件中最具挑战性的 RL 任务之一的长视界稀疏奖励任务,也可以从眼动注视中稳健地预测出来。我们提出了 Int-HRL:一种利用从人类眼动注视中推断出的基于意图的子目标的分层 RL。我们新颖的子目标提取流程是完全自动的,取代了人类专家手动标注子目标的需求。我们的评估表明,用自动提取的意图替代手工制作的子目标,能够产生一个比以前方法样本效率显著更高的 HRL 智能体。

关键词

引用

@article{arxiv.2306.11483,
  title  = {Int-HRL: Towards Intention-based Hierarchical Reinforcement Learning},
  author = {Anna Penzkofer and Simon Schaefer and Florian Strohm and Mihai Bâce and Stefan Leutenegger and Andreas Bulling},
  journal= {arXiv preprint arXiv:2306.11483},
  year   = {2023}
}