桥接状态与历史表征:理解自预测强化学习
机器学习
2024-04-23 v3 人工智能
摘要
表征是所有深度强化学习(RL)方法的核心,无论对于马尔可夫决策过程(MDP)还是部分可观测马尔可夫决策过程(POMDP)。许多表征学习方法和理论框架已被开发出来,以理解什么构成了有效的表征。然而,这些方法之间的关系以及它们共有的属性仍不清楚。在本文中,我们证明,许多这些看似不同的状态和历史抽象方法与框架,实际上都基于一个共同的自预测抽象思想。此外,我们为学习自预测表征时广泛采用的目标和优化技术(例如停止梯度技术)提供了理论见解。这些发现共同产生了一个极简算法,用于学习状态和历史的自预测表征。我们通过将算法应用于标准MDP、带干扰项的MDP以及稀疏奖励的POMDP来验证我们的理论。这些发现最终为RL从业者总结了一套初步指南。
引用
@article{arxiv.2401.08898,
title = {Bridging State and History Representations: Understanding Self-Predictive RL},
author = {Tianwei Ni and Benjamin Eysenbach and Erfan Seyedsalehi and Michel Ma and Clement Gehring and Aditya Mahajan and Pierre-Luc Bacon},
journal= {arXiv preprint arXiv:2401.08898},
year = {2024}
}
备注
ICLR 2024 (Poster). Code is available at https://github.com/twni2016/self-predictive-rl