用于乌尔都语不当内容检测的基于注意力双向 GRU 混合模型
计算与语言
2025-01-17 v1 机器学习
摘要
随着互联网和社交网络在线讨论的增加,社交网站上恶意和不当内容的传播也有所增加。不同语言方面已有多项研究。然而,针对南亚语言使用深度学习技术进行不当内容识别的工作较少。在乌尔都语中,拼写并不唯一,人们对同一个词使用不同的常见拼写,同时将其与英语等其他语言混合在文本中,使其更具挑战性,且使用最优算法处理此类语言的现有研究有限。在深度学习模型中使用注意力层有助于处理长程依赖并提高其效率。为了探索注意力层的效果,本研究提出了基于注意力的双向 GRU 混合模型,用于识别乌尔都语 Unicode 文本中的不当内容。使用了四种不同的基线深度学习模型:LSTM、Bi-LSTM、GRU 和 TCN,来比较所提出模型的性能。这些模型的结果基于评估指标、数据集大小以及词嵌入层的影响进行了比较。我们的案例中使用了预训练的 Urdu word2Vec 嵌入。我们提出的模型 BiGRU-A 在不使用预训练 word2Vec 层的情况下达到了 84% 的准确率,优于所有其他基线模型。从我们的实验中,我们确信注意力层提高了模型的效率,而预训练的 word2Vec 嵌入在不当内容数据集上效果不佳。
引用
@article{arxiv.2501.09722,
title = {Attention based Bidirectional GRU hybrid model for inappropriate content detection in Urdu language},
author = {Ezzah Shoukat and Rabia Irfan and Iqra Basharat and Muhammad Ali Tahir and Sameen Shaukat},
journal= {arXiv preprint arXiv:2501.09722},
year = {2025}
}