衡量无噪声强化学习中一阶马尔可夫违规情况:因果发现方法
机器学习
2025-06-03 v2 人工智能
机器学习
摘要
强化学习(RL)方法常常假设每个新观察值完全反映环境的状态,从而保证马尔可夫(一步)转移。在实际情况下,部分可观测性或传感器/执行器噪声常常使这一假设失效。本文提出了一种系统性的方法,用于检测此类违规情况,将基于偏相关的因果发现过程(PCMCI)与一种新颖的马尔可夫违规得分(MVS)相结合。MVS衡量当噪声或状态信息不完整破坏马尔可夫属性时出现的多步骤依赖关系。作为示例,经典控制任务(CartPole、Pendulum、Acrobot)用于说明如何通过针对性噪声和维度缺失影响RL性能和测量的马尔可夫一致性。意外的是,即使在某些领域(例如Acrobot)出现显著观察噪声,有时也未能引发强烈的多滞后依赖。在 contrast, dimension-dropping investigations显示,排除某些状态变量(例如CartPole和Pendulum中的角速度)显著降低回报并增加MVS,而删除其他维度则影响最小。这些发现突显了定位和保护最具因果本质维度的重要性,以维持有效的单步学习。通过将偏相关检验与RL性能结果相结合,所提出的方法精确识别马尔可夫假设何时何地被违反。该框架为开发稳健的政策、指导表征学习以及解决现实世界RL中的部分可观测性问题提供了原则性方法。所有代码和实验日志均可在 https://github.com/ucsb/markovianess 获取以便重复验证。
引用
@article{arxiv.2503.00206,
title = {Quantifying First-Order Markov Violations in Noisy Reinforcement Learning: A Causal Discovery Approach},
author = {Naveen Mysore},
journal= {arXiv preprint arXiv:2503.00206},
year = {2025}
}
备注
Under review for Neural Information Processing Systems 2025