面向阿拉伯语攻击性语言检测系统的迁移学习方法——基于 BERT 的模型
计算与语言
2021-02-12 v1
摘要
开发检测网络攻击性语言的系统对网络用户的健康与安全非常重要。研究表明,网络仇恨、网络骚扰及其他技术滥用行为呈上升趋势,尤其在 2020 年全球冠状病毒大流行期间。根据反诽谤联盟(ADL)的最新报告,35% 的在线用户报告了与其身份特征相关的网络骚扰,较 2019 年增加 3%。应用自然语言处理(NLP)领域的先进技术来支持构建无仇恨网络社区,是社会正义的一项关键任务。迁移学习通过允许将知识从某一领域或数据集迁移到此前未见过其他数据集,从而提升分类器的性能,进而支持分类器具有更好的泛化能力。在我们的研究中,我们跨多个阿拉伯语攻击性语言数据集应用迁移学习原理,以比较其对系统性能的影响。本研究旨在考察对来自 Transformers 的双向编码器表示(BERT)模型在多个阿拉伯语攻击性语言数据集上分别进行微调与训练,并使用其他数据集分别测试的效果。我们的实验首先比较多个 BERT 模型,以指导用于本研究的主模型选择。该研究还考察了拼接所有数据集用于微调与训练 BERT 模型的效果。我们的结果表明迁移学习对分类器性能的影响有限,尤其对于高度方言化的评论。
引用
@article{arxiv.2102.05708,
title = {Transfer Learning Approach for Arabic Offensive Language Detection System -- BERT-Based Model},
author = {Fatemah Husain and Ozlem Uzuner},
journal= {arXiv preprint arXiv:2102.05708},
year = {2021}
}
备注
2021 4th International Conference on Computer Applications & Information Security (ICCAIS) - Contemporary Computer Technologies and Applications