将因果有向无环图集成到深度强化学习中:通过多阶曝露激活最小马尔可夫状态
机器学习
2026-05-11 v1
摘要
在线强化学习(RL)依赖马尔可夫属性以保证性能,但现实应用中常缺乏针对原始观测变量所定义的明确状态。虽然因果强化学习受到日益关注的注意,但现有工作通常假设马尔可夫状态已提供,并致力于利用因果性加速学习,这留下了一个根本性的空白:给定针对观测变量的纵向因果图,如何构建能够保证满足马尔可夫性质的MDP状态?本文通过提供一种构造可形式化保证最小状态表示的程序来解决此问题。在深度强化学习中,我们观察到,仅凭最小表示在实证上难以提升性能,这表明神经网络无法直接利用马尔可夫最小性。为此,我们提出了MOSE(Multi-Order State Exposure,即多阶状态曝露),将多阶历史状态构造输入到相同的Q函数中。MOSE在常见基准和合成数据集上 consistently 优于最小状态构造和单窗口策略。将最小表示与MOSE并置可进一步提升性能。我们的结果确立了因果深度强化学习的核心原则:最小充分性不够,必须实现“受控冗余”才能发挥因果状态信息的优势。
引用
@article{arxiv.2605.07057,
title = {Integrating Causal DAGs in Deep RL: Activating Minimal Markovian States with Multi-Order Exposure},
author = {Jiamin Xu and Jacqueline Maasch and Kyra Gan},
journal= {arXiv preprint arXiv:2605.07057},
year = {2026}
}