中文

利用有限 Twitter 数据进行性别预测

计算与语言 2020-10-06 v1 人工智能 机器学习

摘要

Transformer 模型在多种 NLP 任务上展现出令人印象深刻的性能。现成的预训练模型可针对特定 NLP 分类任务进行微调,减少对大量额外训练数据的需求。然而,鲜有研究探讨准确微调此类预训练 transformer 模型所需的数据量,以及准确预测所需的数据量。本文探索 BERT(一种用于词嵌入的 Transformer 模型)在社交媒体性别预测上的可用性。法医学应用包括检测性别混淆,例如聊天室中男性冒充女性。一个荷兰语 BERT 模型在按每人所用推文数量不同而变化的、标注了性别的荷兰语 Twitter 数据集不同样本上进行了微调。结果显示,当每人仅用 200 条推文微调时,BERT 有助于良好的性别分类性能(80% F1);而每人仅用 20 条推文时,分类器性能非陡峭地退化(降至 70% F1)。这些结果表明,即便数据量相对较少,BERT 也可被微调以准确辅助预测 Twitter 用户性别,并因此可基于少量推文确定性别。这为快速检测性别提供了实操前景。

关键词

引用

@article{arxiv.2010.02005,
  title  = {Gender prediction using limited Twitter Data},
  author = {Maaike Burghoorn and Maaike H. T. de Boer and Stephan Raaijmakers},
  journal= {arXiv preprint arXiv:2010.02005},
  year   = {2020}
}

备注

6 pages, 2 figures