重新思考因果强化学习中的状态解耦
机器学习
2024-08-27 v1
摘要
在处理噪声时,强化学习(RL)的一个重要挑战是从观察中估计潜在状态。因果性质为确保通过可识别性恢复底层状态提供了严格的理论支持。因此,一些现有工作致力于从因果视角建立可识别性,以辅助算法设计。然而,这些结果常源于纯粹的因果观点,可能忽视了特定的RL情境。我们重新审视这一研究路径,发现纳入RL特定情境可减少先前潜在状态可识别性分析中不必要的假设。更重要的是,移除这些假设允许算法设计超越先前受限于这些假设的边界。基于这些见解,我们提出了一种用于通用部分可观测马尔可夫决策过程(POMDP)的新方法,通过取代先前方法中复杂的结构约束,采用两种简单的约束来保持转换和奖励。通过这两种约束,所提出的算法被保证能忠实于底层动态的解耦状态与噪声。来自广泛基准控制任务的实证证据表明,我们的方法在有效地从噪声中解耦状态信念方面优于现有方法。
引用
@article{arxiv.2408.13498,
title = {Rethinking State Disentanglement in Causal Reinforcement Learning},
author = {Haiyao Cao and Zhen Zhang and Panpan Cai and Yuhang Liu and Jinan Zou and Ehsan Abbasnejad and Biwei Huang and Mingming Gong and Anton van den Hengel and Javen Qinfeng Shi},
journal= {arXiv preprint arXiv:2408.13498},
year = {2024}
}