强化学习中的因果策略学习:基于背门调整的软演员-评论家
机器学习
2025-06-09 v1 人工智能
摘要
潜在混杂因素同时影响状态和动作,可能导致强化学习 (RL) 中的策略学习产生偏差,从而导致次优或不可泛化的行为。大多数 RL 算法忽视了这一问题,仅依据统计关联从观测轨迹中学习策略。我们提出 DoSAC(Do-Calculus Soft Actor-Critic with Backdoor Adjustment),即在软演员-评论家算法基础上的原则性扩展,通过因果干预估计纠正隐藏混杂。DoSAC 利用背门准则估计干预策略 ,无需访问真实混杂变量或因果标签。为实现此目标,我们引入可学习的背门重构器,通过当前状态推断伪过去变量(前一状态和动作),以便从观测数据中进行背门调整。该模块集成到软演员-评论家框架中,用于计算干预策略及其熵。实验在连续控制基准上表明,DoSAC 在混杂环境下超越基线模型,实现更好的鲁棒性、泛化能力和策略可靠性。
引用
@article{arxiv.2506.05445,
title = {Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic},
author = {Thanh Vinh Vo and Young Lee and Haozhe Ma and Chien Lu and Tze-Yun Leong},
journal= {arXiv preprint arXiv:2506.05445},
year = {2025}
}
备注
Preprint