中文

过于美好而难以置信?从滥用语言预测作者画像

计算与语言 2020-09-04 v2

摘要

在线威胁与滥用问题可通过计算方法缓解,其中通过作者画像更好地理解和识别滥用来源。然而,滥用语言构成特定的语言领域,尚未测试文本作者的个性、年龄或性别是否会产生差异。本研究考察作者人口统计特征与滥用语言 versus 正常语言之间的统计关系,并对个性、年龄和性别进行预测实验。尽管在作者特征与语言使用之间建立了一些统计关系,但这些模式并未转化为高预测性能。个性特质预测在实际值的 15% 以内,年龄预测误差边际为 10 年,性别分类正确率为 70%。与先前作者画像研究相比,这些结果较差,因此我们敦促在滥用语言与威胁评估背景下应用此方法时保持谨慎。

关键词

引用

@article{arxiv.2009.01126,
  title  = {Too good to be true? Predicting author profiles from abusive language},
  author = {Isabelle van der Vegt and Bennett Kleinberg and Paul Gill},
  journal= {arXiv preprint arXiv:2009.01126},
  year   = {2020}
}

备注

Pre-print