因果森林的变量重要性:分解处理效应的异质性
机器学习
2023-08-08 v1
摘要
因果随机森林提供了异质处理效应的高效估计。然而,森林算法也以其黑箱性质而著称,因此无法刻画输入变量如何参与处理效应异质性,这是一个很强的实际局限。本文中,我们为因果森林开发了一种新的变量重要性算法,以量化每个输入对处理效应异质性的影响。所提方法受广泛用于回归问题的丢弃并重学(drop and relearn)原则启发。重要的是,我们展示了如何在无混杂变量的情况下处理森林重训练。若混杂变量未参与处理效应异质性,局部中心化步骤保证了重要性度量的一致性。否则,当混杂变量也影响异质性时,我们在重训练的因果森林中引入一项修正项以恢复一致性。此外,在模拟、半合成和真实数据上的实验显示了我们重要性度量的良好性能,在若干测试用例上优于竞争对手。实验还表明,我们的方法可有效扩展至变量组,在实践中提供关键洞见。
引用
@article{arxiv.2308.03369,
title = {Variable importance for causal forests: breaking down the heterogeneity of treatment effects},
author = {Clément Bénard and Julie Josse},
journal= {arXiv preprint arXiv:2308.03369},
year = {2023}
}