中文

利用地理参考语料库映射语言与人口统计特征

计算与语言 2020-04-03 v1

摘要

本文针对取自网络爬取和社交媒体来源的 Large 地理参考语料库,将其与真实人口和语言普查数据集进行比对评估。目标是确定(i)哪个数据集最能代表人口统计特征;(ii)在世界的哪些地区这些数据集最能代表实际人口;(iii)如何对数据集加权以提供更准确的底层人口表征。本文发现两个数据集代表极不同的人口,且它们与实际人口的相关性分别为 r=0.60(社交媒体)和 r=0.49(网络爬取)。此外,Twitter 数据能更好地预测各国所用语言的种类。

关键词

引用

@article{arxiv.2004.00809,
  title  = {Mapping Languages and Demographics with Georeferenced Corpora},
  author = {Jonathan Dunn and Ben Adams},
  journal= {arXiv preprint arXiv:2004.00809},
  year   = {2020}
}

备注

Proceedings of GeoComputation 19