利用地理参考语料库映射语言与人口统计特征
计算与语言
2020-04-03 v1
摘要
本文针对取自网络爬取和社交媒体来源的 Large 地理参考语料库,将其与真实人口和语言普查数据集进行比对评估。目标是确定(i)哪个数据集最能代表人口统计特征;(ii)在世界的哪些地区这些数据集最能代表实际人口;(iii)如何对数据集加权以提供更准确的底层人口表征。本文发现两个数据集代表极不同的人口,且它们与实际人口的相关性分别为 r=0.60(社交媒体)和 r=0.49(网络爬取)。此外,Twitter 数据能更好地预测各国所用语言的种类。
引用
@article{arxiv.2004.00809,
title = {Mapping Languages and Demographics with Georeferenced Corpora},
author = {Jonathan Dunn and Ben Adams},
journal= {arXiv preprint arXiv:2004.00809},
year = {2020}
}
备注
Proceedings of GeoComputation 19