面向数据高效因果效应估计的渐进式泛化风险降低
机器学习
2024-11-19 v1 机器学习
摘要
因果效应估计 (CEE) 为预测实体的未观测反事实结果提供了关键工具。由于 CEE 放宽了对 '完美' 反事实样本 (例如属性相同仅在处理方式不同) 的要求,这些不实用的样本可以操作于观察数据上,通常用于医学治疗效应预测等高风险领域。然而,在这些高风险领域,收集规模适中、完全标记的观察数据集仍然具有挑战,因为涉及成本、伦理、专业知识和所需时间等因素,如医学治疗调查就是典型例子。因此,如果训练数据集规模较小,任何 CEE 算法几乎无法实现低泛化风险。不同于现有的 CEE 方法假设常规可获得大量样本的数据集,本文研究了更真实的 CEE 设置,即在开始时标记数据样本稀缺,而更多可以在训练过程中逐渐获取——在预算有限的情况下。问题自然地归结为主动选择最佳样本进行标记,例如确定下一组患者进行治疗调查。然而,在有限标注预算下降低 CEE 风险的获取质量数据仍然在探索中。为了填补这一空白,我们从 progressively shrinking upper bound 的有趣视角对泛化风险进行理论分析,发展一种专为 CEE 任务设计的原则性标签获取管道。基于我们的分析,我们提出了 Model Agnostic Causal Active Learning (MACAL) 算法用于 batch-wise 标签获取,旨在降低 CEE 模型的不确定性和获取后的 ...
引用
@article{arxiv.2411.11256,
title = {Progressive Generalization Risk Reduction for Data-Efficient Causal Effect Estimation},
author = {Hechuan Wen and Tong Chen and Guanhua Ye and Li Kheng Chai and Shazia Sadiq and Hongzhi Yin},
journal= {arXiv preprint arXiv:2411.11256},
year = {2024}
}
备注
Accepted by KDD'25