中文

用于代码混合 Nepali-English 和 Telugu-English 仇恨语言检测的数据集创建与评估:基于传统和深度学习模型

计算与语言 2025-05-01 v1 人工智能 机器学习 社会与信息网络

摘要

随着多语言用户在社交媒体上的存在增长,检测代码混合文本中的仇恨语言变得越来越具有挑战性。代码混合通信指用户在英语和本国语言之间无缝切换,这对传统仇恨检测模型构成困难,因为侮辱性内容可能是语境相关的或被语言混合掩盖。虽然仇恨语言检测已广泛探索高资源语言如英语和印地语,但低资源语言如 Telugu 和 Nepali 仍属欠 représentative,留下了在有效 moderation 方面的空白。本研究引入了一个新的数据集,包含 2000 条 Telugu-English 和 5000 条 Nepali-English 代码混合评论,按仇恨与非仇恨进行分类,收集自多个社交媒体平台。该数据集经过严格预处理后,在多种机器学习(ML)、深度学习(DL)和大语言模型(LLM)上进行评估。我们实验包括逻辑回归、随机森林、支持向量机(SVM)、神经网络(NN)、LSTM、CNN 和 LLM,通过超参数调优优化其性能,并使用 10 折交叉验证和统计显著性测试(t 检验)进行评估。我们的发现提供了关于在代码混合环境中检测仇恨语言挑战的关键见解,并提供了计算方法的比较分析。本研究通过为 Telugu-English 和 Nepali-English 代码混合文本建立仇恨语言检测基准,推动了低资源语言的 NLP 领域发展。该数据集和见解可有助于开发更稳健的多语言社交媒体环境的 moderation 策略。

关键词

引用

@article{arxiv.2504.21026,
  title  = {Creating and Evaluating Code-Mixed Nepali-English and Telugu-English Datasets for Abusive Language Detection Using Traditional and Deep Learning Models},
  author = {Manish Pandey and Nageshwar Prasad Yadav and Mokshada Adduru and Sawan Rai},
  journal= {arXiv preprint arXiv:2504.21026},
  year   = {2025}
}