中文

面向长视野目标条件强化学习的后继特征路标

机器学习 2021-11-19 v1 人工智能 计算机视觉与模式识别 机器人学

摘要

在真实世界中运行通常要求智能体学习复杂环境并运用该理解实现广泛目标。这一问题称为目标条件强化学习(GCRL),对于长视野目标尤其具有挑战性。现有方法通过用基于图的规划算法增强目标条件策略来解决该问题。然而,它们难以扩展到大型高维状态空间,并假定可获取探索机制以高效收集训练数据。本工作中,我们引入后继特征路标(SFL),一种用于探索大型高维环境从而获得对任意目标均熟练的策略的框架。SFL 利用后继特征(SF)捕捉转移动态的能力,借此通过估计状态新颖性驱动探索,并将状态空间抽象为非参数基于路标的图以实现高层规划。我们进一步利用 SF 直接计算用于路标间遍历的目标条件策略,并用以执行通往已探索状态空间边缘“前沿”路标的计划。在 MiniGrid 与 ViZDoom 上的实验表明,SFL 能高效探索大型高维状态空间,并在长视野 GCRL 任务上优于最先进基线。

关键词

引用

@article{arxiv.2111.09858,
  title  = {Successor Feature Landmarks for Long-Horizon Goal-Conditioned Reinforcement Learning},
  author = {Christopher Hoang and Sungryull Sohn and Jongwook Choi and Wilka Carvalho and Honglak Lee},
  journal= {arXiv preprint arXiv:2111.09858},
  year   = {2021}
}

备注

NeurIPS 2021. Video and code at https://2016choang.github.io/sfl