探究半监督方法与数据增强对罗马尼亚语攻击性语言检测的影响
计算与语言
2024-07-31 v1
摘要
攻击性语言检测是当今数字环境中的一项关键任务,在线平台需要努力维护一个相互尊重且包容的环境。然而,构建稳健的攻击性语言检测模型需要大量标注数据,而获取这些数据可能既昂贵又耗时。半监督学习通过利用标注和未标注数据来创建更准确、更稳健的模型,提供了一种可行的解决方案。在本文中,我们探索了几种不同的半监督方法以及数据增强技术。具体来说,我们实现了八种半监督方法,并仅使用 RO-Offense 数据集中可用的数据进行了实验,在将数据输入模型之前应用了五种增强技术。实验结果表明,其中一些方法比其他方法从增强中获益更多。
引用
@article{arxiv.2407.20076,
title = {Investigating the Impact of Semi-Supervised Methods with Data Augmentation on Offensive Language Detection in Romanian Language},
author = {Elena-Beatrice Nicola and Dumitru-Clementin Cercel and Florin Pop},
journal= {arXiv preprint arXiv:2407.20076},
year = {2024}
}
备注
Accepted at KES 2024