面向持续层次强化学习与规划的自主选项发明
人工智能
2024-12-24 v1
摘要
抽象化是扩大强化学习 (RL) 规模的关键。然而,自动学习抽象状态和动作表征以实现迁移和泛化仍是一个具有挑战性的开放问题。本文提出了一种新方法,用于在持续 RL 环境中发明、表示和利用选项(表示持续时间行为的选项)。该方法针对由长时间范围、稀疏奖励以及未知状态转移和奖励函数特征描述的问题流进行工作。该方法持续学习并维护可解释的状态抽象,并利用其发明具有抽象符号表征的高层选项。这些选项满足三个关键需求:(1) 可组合性,以实现前瞻规划有效解决任务;(2) 可跨问题实例复用,以减少重新学习的需求;(3) 相互独立性,以减少选项之间的干扰。我们的主要贡献在于持续学习可迁移、可泛化的具有符号表征的选项,以及将搜索技术与 RL 集成以高效规划这些所学选项以解决新问题。实验结果表明,所提出的方法能够有效地跨问题实例学习和迁移抽象知识,相较于当前最先进的方法实现了更高的样本效率。
引用
@article{arxiv.2412.16395,
title = {Autonomous Option Invention for Continual Hierarchical Reinforcement Learning and Planning},
author = {Rashmeet Kaur Nayyar and Siddharth Srivastava},
journal= {arXiv preprint arXiv:2412.16395},
year = {2024}
}