中文

因果森林中的诚实估计:何时有帮助,何时有害

机器学习 2026-03-05 v3 机器学习

摘要

因果森林估计处理效应如何随个体变化,指导个性化干预,应用领域包括营销、运营和公共政策。该方法的标准建模实践是诚实估计:将数据分为两份,一份用于定义子群体,另一份用于估计各子群体内的处理效应。这旨在减少过拟合,也是许多软件包中的默认设置。但这是正确的选择吗?在本文中,我们表明诚实估计可能会降低个体层面处理效应估计的准确性,特别是在个体对处理的响应存在显著差异且数据足够丰富以揭示这些差异时。核心问题是一个经典的偏差-方差权衡:诚实降低了过拟合的风险,但增加了欠拟合的风险,因为它限制了用于检测和建模异质性的数据。在7500个基准数据集上,我们发现默认使用诚实的代价可能高达需要多25%的数据才能匹配不使用诚实训练的模型的性能。我们认为诚实最好被理解为一种正则化形式,其使用应由应用目标和实证评估来指导,而非机械地采用。

关键词

引用

@article{arxiv.2506.13107,
  title  = {Honesty in Causal Forests: When It Helps and When It Hurts},
  author = {Yanfang Hou and Carlos Fernández-Loría},
  journal= {arXiv preprint arXiv:2506.13107},
  year   = {2026}
}