中文

ReportAGE:基于推文中自我陈述自动抽取 Twitter 用户确切年龄

计算与语言 2022-01-27 v1

摘要

提升社交媒体数据在研究应用中的效用,需要能够自动检测社交媒体研究群体人口统计信息(包括用户年龄)的方法。本研究的目的是开发并评估一种基于用户推文中的自我陈述自动识别其确切年龄的方法。我们端到端的自动自然语言处理(NLP)流水线 ReportAGE 包含:用于检索可能提及年龄的推文的查询模式、用于区分所检索推文中自我陈述用户确切年龄的(“年龄”推文)与未陈述的(“无年龄”推文)的分类器,以及用于识别年龄的基于规则的抽取。为开发与评估 ReportAGE,我们手动标注了 11,000 条匹配查询模式的推文。基于由全部五名标注者标注的 1000 条推文,区分“年龄”与“无年龄”推文的标注者间一致性(Fleiss' kappa)为 0.80,在标注者达成一致的“年龄”推文中识别确切年龄的一致性为 0.95。基于 RoBERTa-Large 预训练模型的深度神经网络分类器在“年龄”类上取得了最高的 F1 值 0.914(精确率 = 0.905,召回率 = 0.942)。当使用分类器预测结果评估年龄抽取时,“年龄”类 F1 值为 0.855(精确率 = 0.805,召回率 = 0.914)。当直接在留出测试集上评估时,“年龄”类 F1 值为 0.931(精确率 = 0.873,召回率 = 0.998)。我们将 ReportAGE 部署于 245,927 名用户发布的逾 12 亿条推文上,并为其中 132,637 名(54%)预测了年龄。将确切年龄检测扩展至如此大规模用户,可提升社交媒体数据在那些与现有二分类或多分类方法预定义年龄分组不符的研究应用中的效用。

关键词

引用

@article{arxiv.2103.06357,
  title  = {ReportAGE: Automatically extracting the exact age of Twitter users based on self-reports in tweets},
  author = {Ari Z. Klein and Arjun Magge and Graciela Gonzalez-Hernandez},
  journal= {arXiv preprint arXiv:2103.06357},
  year   = {2022}
}