中文

基于 BERT 的阿拉伯语社交媒体作者画像

计算与语言 2019-11-01 v3

摘要

我们报告了在阿拉伯语作者画像与欺骗检测共享任务(APDA)背景下,从社交媒体数据中检测年龄、语言变体和性别的模型。我们构建了基于预训练双向编码器来自转换器(BERT)的简单模型。我们首先在共享任务发布数据的三个数据集上分别对预训练 BERT 模型进行微调。随后,我们使用内部数据对共享任务中的性别和方言数据进行增强,展示了扩充训练数据的效用。我们在共享任务测试数据上的最佳模型是通过对不同数据条件下训练的各种 BERT 模型进行多数投票获得的。我们在年龄上取得了 54.72% 的准确率,方言上 93.75%,性别上 81.67%,以及三项任务上 40.97% 的联合准确率。

关键词

引用

@article{arxiv.1909.04181,
  title  = {BERT-Based Arabic Social Media Author Profiling},
  author = {Chiyu Zhang and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:1909.04181},
  year   = {2019}
}