DADIT:面向意大利语 Twitter 用户人口统计分类的数据集与预测方法比较
计算与语言
2024-03-12 v1
摘要
社会科学家日益使用按人口统计特征分层的社会媒体数据来研究公众的态度、信念和行为。为便于此类分析,我们构建、验证并公开发布了具有代表性的 DADIT 数据集,包含 2 万名意大利语 Twitter 用户的 3000 万条推文,以及他们的个人简介和头像图片。我们用性别、年龄和位置的高质量标签丰富了用户数据。DADIT 使我们能够训练并比较各种 SOTA 模型在预测社交媒体用户性别和年龄方面的性能。具体而言,我们研究了推文是否包含对该任务有价值的信息,因为像 M3 这样的流行分类器并未利用推文。我们基于 XLM 的最佳分类器比常用的竞品 M3 的 F1 提高了多达 53%。特别是在年龄预测方面,分类器从将推文作为特征中获益。我们还在一个德语测试集上验证了这些发现。
引用
@article{arxiv.2403.05700,
title = {DADIT: A Dataset for Demographic Classification of Italian Twitter Users and a Comparison of Prediction Methods},
author = {Lorenzo Lupo and Paul Bose and Mahyar Habibi and Dirk Hovy and Carlo Schwarz},
journal= {arXiv preprint arXiv:2403.05700},
year = {2024}
}
备注
Accepted to LREC-COLING 2024