中文

纠正社会人口选择偏差以改进基于社交媒体的总体预测

社会与信息网络 2022-06-08 v4 计算与语言 计算机与社会

摘要

社交媒体正日益被用于大规模总体预测,例如估计社区健康统计。然而,社交媒体用户通常并非目标总体的代表性样本——即一种“选择偏差”。在社会科学中,此类偏差通常通过再分层技术来解决,即根据其社会人口群体被欠采样或过采样的程度对观测值重新加权。然而,再分层很少被评估用于改善预测。在这项由两部分组成的研究中,我们首先评估标准的“开箱即用”再分层技术,发现它们在从 Twitter 估计美国县级人口健康统计的四项任务中未提供任何改进,且常常甚至降低了预测准确率。性能下降的核心原因似乎在于它们依赖于对每个总体的社会人口统计的稀疏或收缩估计。在我们研究的第二部分,我们开发并评估了 Robust Poststratification(鲁棒后分层),其包含三种解决这些问题的方法:(1) 用于解释收缩的估计量重分配,以及 (2) 自适应分箱和 (3) 知情平滑以处理稀疏的社会人口估计。我们表明,这些方法中的每一种都相较于标准再分层方法显著提升了预测准确率。总体而言,Robust Poststratification 实现了最先进的预测准确率,在受调查生活满意度的情况下使解释方差(R^2)增加了 53.0%,在所有任务上平均增加了 17.8%。

关键词

引用

@article{arxiv.1911.03855,
  title  = {Correcting Sociodemographic Selection Biases for Population Prediction from Social Media},
  author = {Salvatore Giorgi and Veronica Lynn and Keshav Gupta and Farhan Ahmed and Sandra Matz and Lyle Ungar and H. Andrew Schwartz},
  journal= {arXiv preprint arXiv:1911.03855},
  year   = {2022}
}

备注

Published at the 16th International AAAI Conference on Web and Social Media (ICWSM) 2022