中文

地理标记 Twitter 数据中的混杂因素与后果

计算与语言 2015-08-25 v2

摘要

Twitter 常用于识别地理偏好话题、写作风格和实体的定量研究中。这些研究依赖于附加在单条消息上的 GPS 坐标,或每个资料中用户提供的位置字段。在本文中,我们比较了这些数据获取技术并量化了它们引入的偏差;我们还测量了它们对语言分析和基于文本的地理定位的影响。GPS 标记和自报位置产生了可测量不同的语料库,并且这些语言差异部分归因于数据集在年龄和性别构成上的差异。使用潜变量模型推导年龄和性别,我们展示了这些人口统计变量如何与地理相互作用影响语言使用。我们还表明基于文本的地理定位的准确性随人口统计特征而变化,对 40 岁以上男性给出最佳结果。

关键词

引用

@article{arxiv.1506.02275,
  title  = {Confounds and Consequences in Geotagged Twitter Data},
  author = {Umashanthi Pavalanathan and Jacob Eisenstein},
  journal= {arXiv preprint arXiv:1506.02275},
  year   = {2015}
}

备注

final version for EMNLP 2015