阿马哈克语恶意言论检测与分类:基于深度学习的方法
计算与语言
2024-08-08 v1 机器学习
摘要
恶意言论是社交媒体上日益增长的问题,尤其在以埃塞俄比亚为例的国家,可能引发不同族群和宗教团体之间的冲突。虽然资源丰富的语言上的恶意言论检测正在进展,但针对资源匮乏的语言(如阿马哈克语)则缺乏。为填补这一差距,我们开发了阿马哈克语恶意言论数据集和 SBi-LSTM 深度学习模型,可将文本检测并分类为四类恶意言论:种族、宗教、性别和非恶意言论。我们标注了 5000 条阿马哈克语社交媒体帖子和评论,分为四个类别。数据由总计 100 名阿马哈克语母语者通过定制标注工具完成。该模型实现了 94.8 的 F1 分数性能。未来改进将包括扩大数据集并开发更先进的模型。
引用
@article{arxiv.2408.03849,
title = {Hate Speech Detection and Classification in Amharic Text with Deep Learning},
author = {Samuel Minale Gashe and Seid Muhie Yimam and Yaregal Assabie},
journal= {arXiv preprint arXiv:2408.03849},
year = {2024}
}
备注
Dataset: https://data.mendeley.com/datasets/p74pfhz3yx/1