利用含噪自我报告预测 Twitter 用户人口统计特征
计算与语言
2021-07-13 v2
摘要
计算社会科学研究常将内容分析置于标准人口统计背景中。由于许多社交媒体平台(如 Twitter)上无法获取人口统计信息,大量研究自动推断人口统计特征。尽管许多研究展示了种族和族裔概念验证推断,但由于标注数据集稀少,实用系统的训练仍难以实现。现有数据集规模小、不准确,或未能覆盖美国四种最常见的种族和族裔群体。我们提出一种从 Twitter 个人资料描述中识别种族和族裔自我报告的方法。尽管自动化监督存在固有错误,我们在黄金标准自我报告调查数据上测得了性能良好的模型。结果是一种可复现的、用于创建大规模种族和族裔训练资源的方法。
引用
@article{arxiv.2005.00635,
title = {Using Noisy Self-Reports to Predict Twitter User Demographics},
author = {Zach Wood-Doughty and Paiheng Xu and Xiao Liu and Mark Dredze},
journal= {arXiv preprint arXiv:2005.00635},
year = {2021}
}
备注
The first two authors had an equal contribution. Accepted to SocialNLP @ NAACL 2021