深度代理因果学习及其在混杂_bandit策略评估中的应用
机器学习
2024-06-19 v5 机器学习
摘要
代理因果学习(PCL)是一种在存在未观测混杂的情况下,利用混杂因子的代理变量(结构化侧信息)来估计处理对结果的因果效应的方法。这是通过两阶段回归实现的:在第一阶段,我们对处理与代理变量之间的关系进行建模;在第二阶段,我们利用该模型在代理变量所提供的上下文条件下学习处理对结果的影响。PCL在保证可识别性条件下能够恢复真实的因果效应。我们提出了一种新颖的PCL方法——深度特征代理变量方法(DFPV),以应对代理变量、处理和结果均为高维且存在由深度神经网络特征所表示的非线性复杂关系的情况。我们表明,在具有挑战性的合成基准(包括涉及高维图像数据的设置)上,DFPV优于近期最先进的PCL方法。此外,我们展示了PCL可应用于混杂bandit问题的离策略评估,其中DFPV也表现出具有竞争力的性能。
引用
@article{arxiv.2106.03907,
title = {Deep Proxy Causal Learning and its Application to Confounded Bandit Policy Evaluation},
author = {Liyuan Xu and Heishiro Kanagawa and Arthur Gretton},
journal= {arXiv preprint arXiv:2106.03907},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2010.07154