文本数据匹配:文档匹配方法与匹配质量度量的实验评估
统计方法学
2019-03-15 v7 计算与语言
摘要
用于因果推断的匹配是一个被充分研究的问题,但当待匹配单元为文本文档时,标准方法失效:数据的高维与丰富性使精确匹配不可行,导致倾向得分产生不可比的匹配,并使匹配质量评估困难。本文刻画了一个文本文档匹配框架,将现有方法分解为:(1)文本表示的选择,以及(2)距离度量的选择。我们通过使用人类受试者的系统性多因素评估实验,考察该框架内不同选择对匹配数量与质量的影响。我们总共评估了100余种独特文本匹配方法以及取自文献的5种对比方法。实验结果表明,某些方法生成匹配的主管匹配质量高于当前SOTA技术。我们通过建立预测模型来估计文本文档对的匹配质量(作为各距离得分的函数),从而提升结果的精度。我们发现该模型成功模仿人类判断,并允许对新方法进行近似且无监督的评估。随后,我们采用所识别的最佳方法,在两个应用中展示文本匹配的效用。首先,我们在研究媒体偏见的实质性争论中,使用文本匹配在比较十三家新闻来源的新闻文章时控制主题选择。然后,我们展示在一项考察医疗干预效果的观察性研究中,以文本数据为条件可得到更精确的因果推断。
引用
@article{arxiv.1801.00644,
title = {Matching with Text Data: An Experimental Evaluation of Methods for Matching Documents and of Measuring Match Quality},
author = {Reagan Mozer and Luke Miratrix and Aaron Russell Kaufman and L. Jason Anastasopoulos},
journal= {arXiv preprint arXiv:1801.00644},
year = {2019}
}