从本体感知到新环境中的长时域规划:一种分层强化学习模型
机器人学
2020-06-12 v1 人工智能
机器学习
摘要
对于一个智能体而言,要在复杂环境中灵活且高效地运作,必须能够在时间、空间和概念抽象的不同层次上进行推理。在较低层次,智能体必须解释其本体感知输入并控制其肌肉;在较高层次,智能体必须选择目标并规划如何实现这些目标。显然,这些不同类型的推理适用于不同的表示、算法和输入。在本工作中,我们引入了一个简单的三级分层架构来反映这些区别。低级控制器处理连续的本体感知输入,使用无模型学习来获取有用的行为。这些行为进而诱导出一组中级动力学,由中级控制器学习并用于模型预测控制,以在每个时间步选择要激活的行为。高级控制器利用离散的图表示进行目标选择和路径规划,为中级控制器指定目标。我们将我们的方法应用于 Mujoco Ant 环境中的一系列导航任务,与先前的无模型、基于模型以及分层 RL 方法相比,始终表现出显著的数据效率提升。最后,作为我们架构优势的一个说明性示例,我们将我们的方法应用于一个需要高效探索和长时域规划的复杂迷宫环境。
引用
@article{arxiv.2006.06620,
title = {From proprioception to long-horizon planning in novel environments: A hierarchical RL model},
author = {Nishad Gothoskar and Miguel Lázaro-Gredilla and Dileep George},
journal= {arXiv preprint arXiv:2006.06620},
year = {2020}
}