中文

基于预测的马尔可夫违规得分用于检测强化学习中的非马尔可夫观测

机器学习 2026-05-08 v2 人工智能 机器学习

摘要

强化学习算法假设观测满足马尔可夫性质,但实际中的传感器常通过相关噪声、延迟或部分可观测性违反这一假设。标准性能指标会将马尔可夫违规与其他次优性来源混合,使实践者缺乏检测此类违规的工具。本文引入基于预测的马尔可夫违规得分(MVS),用于量化观测轨迹中的非马尔可夫结构。首先使用随机森林消除非线性马尔可夫符合的动力学,然后使用岭回归测试历史观测是否能在残差上减少预测误差,超出当前观测提供的效果。得到的得分受限于 [0, 1],且无需构建因果图。评估涵盖六个环境(CartPole、Pendulum、Acrobot、HalfCheetah、Hopper、Walker2d)、三个算法(PPO、A2C、SAC)、受控的 AR(1) 噪声六个强度水平、每个条件 10 个随机种子。在事后检测中,7 个 16 个环境-算法组合中,主要是高维运动任务,显示出噪声强度与 MVS 之间呈显著正单调关系(Spearman rho 最高达 0.78,通过重复测量分析验证);在训练时噪声下,13 个 16 个组合表现出显著的奖励退化。在低维环境中发现一种逆转现象,即随机森林吸收噪声信号,导致 MVS 随着真实违规增大而减小,这一失效模式在文中详细分析。实用性实验表明,MVS 正确识别了部分可观测性,并指导了架构选择,成功恢复了因非马尔可夫观测而损失的性能。所有结果的复现代码已发布于 https://github.com/NAVEENMN/Markovianes。

关键词

引用

@article{arxiv.2603.27389,
  title  = {Prediction-Based Markov Violation Scores for Detecting Non-Markovian Observations in Reinforcement Learning},
  author = {Naveen Mysore},
  journal= {arXiv preprint arXiv:2603.27389},
  year   = {2026}
}

备注

Accepted at RLC 2026, to appear in Reinforcement Learning Journal