中文

基于中介分析的因果变量强化学习

机器学习 2022-05-18 v2

摘要

机器学习的许多开放问题本质上与因果相关,然而因果分析在机器学习中的应用仍处于早期阶段。在一般强化学习设定下,我们考虑构建一个通用强化学习智能体的问题,该智能体利用经验构建环境的因果图,并用此图指导其策略。我们的方法具有三个特点:首先,我们学习一个简单的、粗粒度的因果图,其中变量反映多个时间实例的状态,干预发生在策略层面而非单个动作层面。其次,我们利用中介分析获得优化目标。通过最小化该目标,我们定义因果变量。第三,我们的方法依赖于估计条件期望而非强化学习中常见的期望回报,因此我们应用了 Bellman 方程的推广形式。我们展示了该方法能在网格世界环境中学习到合理的因果图,且智能体在使用因果指导的策略时性能得到提升。据我们所知,这是在强化学习设定中无需对状态数量施加严格限制的首次因果分析尝试。我们观察到中介分析为将因果获取问题转化为代价函数最小化问题提供了有前景的途径,但重要的是其涉及估计条件期望。这是一项新挑战,我们认为因果强化学习将需要开发适用于此类条件期望在线估计的方法。最后,我们方法的一个优势是使用非常简单的因果模型,这可以说是人类因果理解更自然的模型。

关键词

引用

@article{arxiv.2010.15745,
  title  = {Reinforcement Learning of Causal Variables Using Mediation Analysis},
  author = {Tue Herlau and Rasmus Larsen},
  journal= {arXiv preprint arXiv:2010.15745},
  year   = {2022}
}

备注

As accepted at proceedings of the AAAI Conference on Artificial Intelligence (AAAI), AAAI, 2022