Int-HRL:迈向基于意图的分层强化学习
机器学习
2023-06-21 v1
摘要
尽管深度强化学习 (RL) 智能体在越来越多的任务上超越了人类,但训练它们需要相当于数十年人类游戏的数据量。近期的分层 RL 方法通过纳入决策问题结构所固有的信息提高了样本效率,但代价是需要发现或使用人类标注的子目标来引导学习过程。我们表明,人类玩家的意图,即目标导向决策的前体,即使对于 Montezuma's Revenge 这一 Atari2600 游戏套件中最具挑战性的 RL 任务之一的长视界稀疏奖励任务,也可以从眼动注视中稳健地预测出来。我们提出了 Int-HRL:一种利用从人类眼动注视中推断出的基于意图的子目标的分层 RL。我们新颖的子目标提取流程是完全自动的,取代了人类专家手动标注子目标的需求。我们的评估表明,用自动提取的意图替代手工制作的子目标,能够产生一个比以前方法样本效率显著更高的 HRL 智能体。
引用
@article{arxiv.2306.11483,
title = {Int-HRL: Towards Intention-based Hierarchical Reinforcement Learning},
author = {Anna Penzkofer and Simon Schaefer and Florian Strohm and Mihai Bâce and Stefan Leutenegger and Andreas Bulling},
journal= {arXiv preprint arXiv:2306.11483},
year = {2023}
}