中文

分布式数据上的协作因果推断

统计方法学 2024-01-18 v5 机器学习

摘要

近年来,具有分布式数据隐私保护功能的因果推断技术的发展受到了相当多的关注。许多现有的分布式数据方法侧重于解决受试者(样本)不足的问题,且只能减少处理效应估计中的随机误差。在本研究中,我们提出一种数据协作准实验(DC-QE),可同时解决受试者和协变量不足的问题,从而减少估计中的随机误差与偏差。我们的方法包括:从本地方的私有数据构建降维的中间表示,共享中间表示而非私有数据以实现隐私保护,从共享的中间表示估计倾向得分,最后从倾向得分估计处理效应。通过在人工和真实世界数据上的数值实验,我们确认该方法比单独分析获得更好的估计结果。尽管降维会丢失私有数据中的部分信息并导致性能下降,但我们观察到与多方共享中间表示以同时解决受试者和协变量不足,能充分提升性能以克服降维引起的退化。虽然外部效度未必得到保证,我们的结果表明 DC-QE 是一种有前景的方法。随着该方法的广泛使用,中间表示可作为开放数据发布,以帮助研究者发现因果关系并积累知识库。

关键词

引用

@article{arxiv.2208.07898,
  title  = {Collaborative causal inference on distributed data},
  author = {Yuji Kawamata and Ryoki Motai and Yukihiko Okada and Akira Imakura and Tetsuya Sakurai},
  journal= {arXiv preprint arXiv:2208.07898},
  year   = {2024}
}

备注

16 pages, 4 figures