面向空间或时空干扰下的因果深度集合(Causal Deepsets)进行离策略评估
机器学习
2024-07-26 v1 人工智能
机器学习
摘要
离策略评估(OPE)在制药和电子商务等领域广泛应用,用于从离线数据集中评估新产品或政策的效果。本文引入一种因果深度集合框架,放宽了现有 OPE 方法中处理时空干扰时普遍存在的若干关键结构假设,主要包括均值场假设。这些传统假设在实际场景中常常不充分,从而限制了当前 OPE 方法有效应对复杂干扰效应的能力。为此,我们主张实施置换不变性(PI)假设。这种创新方法使均值场函数能够实现数据驱动、自适应地学习,提供了超越传统平均方法的更灵活的估计方法。此外,我们提出了若干新算法,将 PI 假设纳入 OPE,并充分考察了其理论基础。我们的数值分析表明,这种新方法的估计精度显著高于现有基线算法,从而大幅提升了 OPE 方法的实际适用性和有效性。我们提供的 Python 实现已公开于 https://github.com/BIG-S2/Causal-Deepsets。
引用
@article{arxiv.2407.17910,
title = {Causal Deepsets for Off-policy Evaluation under Spatial or Spatio-temporal Interferences},
author = {Runpeng Dai and Jianing Wang and Fan Zhou and Shikai Luo and Zhiwei Qin and Chengchun Shi and Hongtu Zhu},
journal= {arXiv preprint arXiv:2407.17910},
year = {2024}
}