ParMod:用于学习非马尔可夫任务的并行与模块化框架
机器学习
2024-12-18 v1 人工智能
摘要
常用的强化学习(RL)模型 MDP(马尔可夫决策过程)的基本前提是奖励仅取决于当前状态和动作。然而,许多现实世界的任务是非马尔可夫的,具有长期记忆和依赖性。奖励稀疏问题在非马尔可夫场景中被进一步放大。因此,学习非马尔可夫任务(NMT)本质上比学习马尔可夫任务更困难。在本文中,我们提出了一种新颖的并行与模块化强化学习框架 ParMod,专门用于学习由时序逻辑指定的 NMT。借助形式化技术,NMT 被模块化为基于自动机结构(等价于其时序逻辑对应物)的一系列子任务。在此基础上,子任务将由一组智能体以并行方式进行训练,每个智能体处理一个子任务。除了并行训练,ParMod 的核心还在于:一种用于模块化 NMT 的灵活分类方法,以及一种用于提高样本效率的有效奖励塑造方法。我们在几个具有挑战性的基准问题上针对各种指标进行了综合评估。实验结果表明,ParMod 在其他相关研究之上取得了优越的性能。因此,我们的工作在强化学习、非马尔可夫任务和时序逻辑之间提供了良好的协同作用。
引用
@article{arxiv.2412.12700,
title = {ParMod: A Parallel and Modular Framework for Learning Non-Markovian Tasks},
author = {Ruixuan Miao and Xu Lu and Cong Tian and Bin Yu and Zhenhua Duan},
journal= {arXiv preprint arXiv:2412.12700},
year = {2024}
}