中文

从多语言社交媒体数据进行人口统计推断与代表性人口估计

计算机与社会 2019-05-16 v1 计算与语言 计算机视觉与模式识别 机器学习

摘要

社交媒体以前所未有的规模和粒度提供对行为数据的访问。然而,由于这些数据的非代表性以及统计推断工具对主导语言和群体的偏向,利用这些数据理解更广泛人群中的现象十分困难。尽管人口统计属性推断可用于缓解此类偏差,但当前技术几乎完全是单语的,无法在全球环境中工作。我们通过结合多语言人口统计推断与事后分层来创建更具代表性的人口样本,以应对这些挑战。为学习人口统计属性,我们创建了一种新的多模态深度神经架构,用于对社交媒体用户的年龄、性别和组织状态进行联合分类,支持 32 种语言。该方法在大幅优于当前最先进水平的同时也减少了算法偏差。为纠正采样偏差,我们提出完全可解释的多层回归方法,从推断的联合人口计数和真实人口计数估计包含概率。在一项针对多语言异质欧洲区域的大规模实验中,我们表明我们的人口统计推断与偏差校正共同允许更准确的人口估计,并向具有多语言社交媒体的下游应用中的代表性社会感知迈出重要一步。

关键词

引用

@article{arxiv.1905.05961,
  title  = {Demographic Inference and Representative Population Estimates from Multilingual Social Media Data},
  author = {Zijian Wang and Scott A. Hale and David Adelani and Przemyslaw A. Grabowicz and Timo Hartmann and Fabian Flöck and David Jurgens},
  journal= {arXiv preprint arXiv:1905.05961},
  year   = {2019}
}

备注

12 pages, 10 figures, Proceedings of the 2019 World Wide Web Conference (WWW '19)