文本与因果推断:利用文本消除因果估计中混杂因素的综述
计算与语言
2020-05-05 v1
摘要
计算社会科学许多应用旨在从非实验数据推断因果结论。此类观测数据常包含混杂因素,即同时影响潜在原因和潜在结果的变量。未测量或潜在的混杂因素会使因果估计产生偏倚,这促使人们关注从观测文本中测量潜在混杂因素。例如,个人的全部社交媒体发帖历史或新闻文章内容可提供多个混杂因素的丰富测量。然而,针对该问题的方法与应用分散在不同社区,且评估实践不一致。本综述首次收集并分类这些实例,并提供数据处理与评估决策的指南。尽管利用文本调整混杂因素受到越来越多关注,仍存在许多开放问题,我们在本文中予以强调。
引用
@article{arxiv.2005.00649,
title = {Text and Causal Inference: A Review of Using Text to Remove Confounding from Causal Estimates},
author = {Katherine A. Keith and David Jensen and Brendan O'Connor},
journal= {arXiv preprint arXiv:2005.00649},
year = {2020}
}
备注
Accepted to ACL 2020