中文

使用 BERT 模型的不同文本预处理技术如何影响作者性别画像

计算与语言 2021-09-29 v1

摘要

司法作者画像在指示嫌疑人的可能特征方面发挥着重要作用。在最近提出的许多用于作者画像的自动化解决方案中,迁移学习胜过自然语言处理中的许多其他 SOTA 技术。然而,这种复杂的技术尚未在作者画像中得到充分利用。同时,尽管当前基于特征工程的作者画像方法在所使用的每个模型中引发了显著的差异,但迁移学习通常需要将预处理后的文本输入模型。我们回顾了文献中的多处参考,并确定了与作者性别画像相关的最常见预处理技术。考虑到潜在预处理技术的多样性,我们进行了一项实验研究,应用了五种此类技术,以测量在使用 BERT 模型时每种技术的效果,选择 BERT 是因为它是使用最广泛的现成预训练模型之一。我们使用 Hugging face transformer 库为每种预处理情况实现了代码。在我们的五项实验中,我们发现当不应用任何预处理技术时,BERT 在预测作者性别时达到了最佳准确率。我们的最佳情况在预测作者性别时达到了 86.67% 的准确率。

关键词

引用

@article{arxiv.2109.13890,
  title  = {How Different Text-preprocessing Techniques Using The BERT Model Affect The Gender Profiling of Authors},
  author = {Esam Alzahrani and Leon Jololian},
  journal= {arXiv preprint arXiv:2109.13890},
  year   = {2021}
}