中文

结合主动学习的多任务学习用于阿拉伯语冒犯性言论检测

计算与语言 2025-06-04 v1

摘要

社交媒体的快速增长放大了冒犯性、暴力和粗俗言论的传播,这引发了严重的社会和网络安全担忧。由于标注数据有限、方言差异以及语言固有的复杂性,检测阿拉伯语文本中的此类内容尤为复杂。本文提出了一个将多任务学习 (MTL) 与主动学习相结合的新框架,以增强阿拉伯语社交媒体文本中的冒犯性言论检测。通过在暴力和粗俗言论这两个辅助任务上进行联合训练,模型利用共享表示来提高冒犯性言论的检测准确率。我们的方法在训练期间动态调整任务权重,以平衡每个任务的贡献并优化性能。为了解决标注数据稀缺的问题,我们通过几种不确定性采样技术采用主动学习策略,迭代地为模型训练选择信息量最大的样本。我们还引入了加权表情符号处理,以更好地捕捉语义线索。在 OSACT2022 数据集上的实验结果表明,所提出的框架实现了 85.42% 的最先进宏观 F1 分数,在使用显著更少微调样本的情况下优于现有方法。本研究的发现突出了将 MTL 与主动学习相结合在资源受限环境中实现高效准确冒犯性言论检测的潜力。

关键词

引用

@article{arxiv.2506.02753,
  title  = {Multi-task Learning with Active Learning for Arabic Offensive Speech Detection},
  author = {Aisha Alansari and Hamzah Luqman},
  journal= {arXiv preprint arXiv:2506.02753},
  year   = {2025}
}