中文

利用含噪自我报告预测 Twitter 用户人口统计特征

计算与语言 2021-07-13 v2

摘要

计算社会科学研究常将内容分析置于标准人口统计背景中。由于许多社交媒体平台(如 Twitter)上无法获取人口统计信息,大量研究自动推断人口统计特征。尽管许多研究展示了种族和族裔概念验证推断,但由于标注数据集稀少,实用系统的训练仍难以实现。现有数据集规模小、不准确,或未能覆盖美国四种最常见的种族和族裔群体。我们提出一种从 Twitter 个人资料描述中识别种族和族裔自我报告的方法。尽管自动化监督存在固有错误,我们在黄金标准自我报告调查数据上测得了性能良好的模型。结果是一种可复现的、用于创建大规模种族和族裔训练资源的方法。

关键词

引用

@article{arxiv.2005.00635,
  title  = {Using Noisy Self-Reports to Predict Twitter User Demographics},
  author = {Zach Wood-Doughty and Paiheng Xu and Xiao Liu and Mark Dredze},
  journal= {arXiv preprint arXiv:2005.00635},
  year   = {2021}
}

备注

The first two authors had an equal contribution. Accepted to SocialNLP @ NAACL 2021