近似超状态空间中的元强化学习探索
机器学习
2021-06-11 v3 人工智能
机器学习
摘要
为快速学习新任务,智能体高效探索往往至关重要——尤其在从第一时间步起性能就很重要时。学习此类行为的一种途径是通过元学习。然而,许多现有方法依赖密集奖励进行元训练,并在奖励稀疏时可能灾难性失败。若无合适奖励信号,元训练期间的探索需求被加剧。为此,我们提出 HyperX,它使用新颖的奖励激励进行元训练,以在近似超状态空间(其中超状态表示环境状态与智能体的任务信念)中探索。我们经验性地表明,HyperX 比现有方法更好地元学习任务探索,并更成功地适应新任务。
引用
@article{arxiv.2010.01062,
title = {Exploration in Approximate Hyper-State Space for Meta Reinforcement Learning},
author = {Luisa Zintgraf and Leo Feng and Cong Lu and Maximilian Igl and Kristian Hartikainen and Katja Hofmann and Shimon Whiteson},
journal= {arXiv preprint arXiv:2010.01062},
year = {2021}
}
备注
Published at the International Conference on Machine Learning (ICML) 2021