面向仇恨言论检测的自动文本规范化
计算与语言
2024-07-26 v4
摘要
社交媒体数据是研究的重要资源,但其包含大量非标准词(NSW)。这些不规则现象阻碍了NLP工具的有效运行。当前越南语的最先进方法将这一问题视为词汇规范化问题,涉及创建人工规则或实现多阶段深度学习框架,这需要大量精力来制定复杂规则。相比之下,我们的方法简洁,仅采用序列到序列(Seq2Seq)模型。在本研究中,我们提供了一个文本规范化数据集,包含2181条人工标注评论,标注者间一致性为0.9014。通过利用Seq2Seq模型进行文本规范化,我们的结果显示所达到的准确率略低于70%。尽管如此,文本规范化将仇恨言论检测(HSD)任务的准确率提升了约2%,展示了其改进复杂NLP任务性能的潜力。我们的数据集可供研究使用。
引用
@article{arxiv.2311.06851,
title = {Automatic Textual Normalization for Hate Speech Detection},
author = {Anh Thi-Hoang Nguyen and Dung Ha Nguyen and Nguyet Thi Nguyen and Khanh Thanh-Duy Ho and Kiet Van Nguyen},
journal= {arXiv preprint arXiv:2311.06851},
year = {2024}
}
备注
2023 International Conference on Intelligent Systems Design and Applications (ISDA2023)