中文

基于选项索引的分层强化学习将选项匹配到任务

机器学习 2022-06-14 v1

摘要

分层强化学习中的选项框架将总体目标分解为选项或更简单任务及关联策略的组合,从而在动作空间中实现抽象。理想情况下,这些选项可在不同高层目标间复用;事实上,这种复用对于实现能够有效利用既往经验的持续学习智能体的愿景是必要的。以往方法仅提出了将预学习选项迁移到新任务设置的有限形式。我们提出一种新颖的选项索引分层学习方法(OI-HRL),学习选项与环境中所出现物品之间的亲和度函数。这使我们能够在测试时通过仅将目标导向学习限制于与当前任务相关的选项,来零样本泛化地有效复用大型预训练选项库。我们开发了一个元训练循环,通过融入所检索选项对高层目标相关性的反馈,在一系列 HRL 问题上学习选项与环境的表示。我们在两个模拟环境——CraftWorld 和 AI2THOR——中评估 OI-HRL,结果表明我们取得了与神谕基线相竞争的性能,并相较拥有完整选项池用于学习分层策略的基线获得显著提升。

关键词

引用

@article{arxiv.2206.05750,
  title  = {Matching options to tasks using Option-Indexed Hierarchical Reinforcement Learning},
  author = {Kushal Chauhan and Soumya Chatterjee and Akash Reddy and Balaraman Ravindran and Pradeep Shenoy},
  journal= {arXiv preprint arXiv:2206.05750},
  year   = {2022}
}

备注

10 pages, 4 figures