基于时空聚类的分层强化学习中的选项发现
机器学习
2020-09-23 v3 人工智能
计算机视觉与模式识别
神经与进化计算
摘要
本文介绍了一种强化学习中的自动化技能获取框架,其涉及根据给定的任务在抽象状态以及抽象状态之间的扩展动作方面识别分层描述。识别任务中存在的此类结构提供了简化和加速强化学习算法的方法。这些结构还有助于在多个任务上泛化此类算法,而无需从头重新学习策略。我们利用动力系统中的思想寻找状态空间中的亚稳态区域,并将其与抽象状态相关联。谱聚类算法PCCA+被用于识别与底层结构对齐的合适抽象。技能根据导致此类抽象状态之间转换的动作序列来定义。来自PCCA+的连通性信息用于生成这些技能或选项(options)。这些技能独立于学习任务,并且可以在定义于同一模型上的各种任务中高效重用。即使没有精确的环境模型,该方法也能通过利用样本轨迹构建近似估计而良好工作。我们还提出了将技能获取框架扩展到具有大状态空间的复杂任务的方法,为此我们使用从动作条件视频预测网络学习的表示进行状态聚合,并在聚合状态空间上使用技能获取框架。
引用
@article{arxiv.1605.05359,
title = {Option Discovery in Hierarchical Reinforcement Learning using Spatio-Temporal Clustering},
author = {Aravind Srinivas and Ramnandan Krishnamurthy and Peeyush Kumar and Balaraman Ravindran},
journal= {arXiv preprint arXiv:1605.05359},
year = {2020}
}
备注
Revised version of ICML 16 Abstraction in Reinforcement Learning workshop paper