面向POMDP的基于记忆的深度强化学习
机器学习
2021-09-14 v5 人工智能
机器人学
摘要
深度强化学习(DRL)的一个有前景的特性是其能够以端到端方式学习最优策略,而无需依赖特征工程。然而,大多数方法假设完全可观测的状态空间,即完全可观测马尔可夫决策过程(MDPs)。在真实世界机器人中,这一假设是不切实际的,因为存在诸如传感器灵敏度限制和传感器噪声,以及缺乏关于观测设计是否完备的知识等问题。这些场景导致部分可观测MDPs(POMDPs)。在本文中,我们通过向TD3引入记忆组件,提出基于长短期记忆的双延迟深度确定性策略梯度(LSTM-TD3),并在MDPs和POMDPs中将其性能与其他DRL算法进行比较。我们的结果展示了记忆组件在处理POMDPs方面的显著优势,包括处理缺失和噪声观测数据的能力。
引用
@article{arxiv.2102.12344,
title = {Memory-based Deep Reinforcement Learning for POMDPs},
author = {Lingheng Meng and Rob Gorbet and Dana Kulić},
journal= {arXiv preprint arXiv:2102.12344},
year = {2021}
}
备注
15 pages, 14 figures