基于集合可达性分析的层次强化学习中的目标空间抽象
机器学习
2024-12-20 v2 人工智能
摘要
开放式学习极大地受益于使用符号方法进行目标表示,因为这些方法为高效且可迁移的学习提供了结构化知识的途径。然而,现有的依赖符号推理的层次强化学习(HRL)方法常常受限,因为它们需要人工目标表示。自主发现符号目标表示的挑战在于其必须保留关键信息,例如环境动态。本文提出一种通过涌现表示进行目标发现的发展机制,该表示将任务中具有相似作用的环境状态集合进行抽象(即归为一组)。我们引入一种封建式 HRL 算法,同时学习目标表示与层次策略。该算法利用神经网络的符号可达性分析来近似状态集合间的转移关系并精炼目标表示。我们在复杂导航任务上评估了我们的方法,表明所学表示具有可解释性、可迁移性,并能实现数据高效的学习。
引用
@article{arxiv.2309.07675,
title = {Goal Space Abstraction in Hierarchical Reinforcement Learning via Set-Based Reachability Analysis},
author = {Mehdi Zadem and Sergio Mover and Sao Mai Nguyen},
journal= {arXiv preprint arXiv:2309.07675},
year = {2024}
}