中文

面向最小化遗憾控制的观测性与干预性因果学习

机器学习 2022-12-06 v1 人工智能 机器学习

摘要

我们探究如何将观测性与干预性因果发现方法相结合。我们将一种最先进的、能够处理潜在混杂因素与同期效应的时间序列观测性因果发现算法 LPCMCI 进行扩展,使其受益于通过随机对照试验发现的因果约束。数值结果表明,在给定完美干预约束的条件下,扩展版 LPCMCI 所重建的结构因果模型(SCMs)有 84.6% 的时间能够对目标变量做出最优预测。干预性与观测性因果发现的实现是模块化的,允许来自其他来源的因果约束。本文第二部分研究通过同时学习因果模型并基于该因果模型规划动作来实现最小化遗憾控制的问题。其思想是,一个旨在优化某被测变量的智能体首先通过观测性因果发现学习系统的机理,随后以随机取值对最有前景的变量进行干预,从而利用并生成新的干预数据;智能体再使用这些干预数据进一步优化因果模型,以便在下次采取更优动作。相较于原始 LPCMCI 算法,扩展版 LPCMCI 更具优势。数值结果显示,与使用原始 LPCMCI 算法时 53.6% 的基线相比,检测并利用干预约束所重建的 SCMs 有 60.9% 的时间可对目标变量做出最优预测。此外,由此引起的平均遗憾从使用原始 LPCMCI 算法时的 1.2 降至使用带干预发现的扩展版 LPCMCI 算法时的 1.0。

关键词

引用

@article{arxiv.2212.02435,
  title  = {Observational and Interventional Causal Learning for Regret-Minimizing Control},
  author = {Christian Reiser},
  journal= {arXiv preprint arXiv:2212.02435},
  year   = {2022}
}