基于监督机器学习与特征组合的乌尔都语辱骂及威胁语言检测
计算与语言
2022-04-08 v1
摘要
本文介绍了提交至 FIRE 2021 共享任务“乌尔都语辱骂与威胁语言检测任务”的系统描述。该挑战旨在自动识别用乌尔都语撰写的辱骂性和威胁性推文。我们的提交结果在竞赛中获得了第三名的认可。本文报告了使我们达到提交结果的一系列非穷举实验。此外,在竞赛结果公布后,我们取得了比提交结果更好的成绩。我们的模型在任务 A(乌尔都语推文辱骂语言检测)上取得了 0.8318 的 F1 分数,在任务 B(乌尔都语推文威胁语言检测)上取得了 0.4931 的 F1 分数。结果表明,对于任务 A,采用去除停用词、应用词形还原、并由 n=1,2,3 的词 n-gram 组合构建特征向量的支持向量机(SVM)取得了最佳结果。对于任务 B,采用去除停用词、不应用词形还原、由预训练乌尔都语 Word2Vec(基于词 unigram 和 bigram)创建特征向量、并使用过采样技术平衡数据集的支持向量机取得了最佳结果。代码已公开以保证可复现性。
引用
@article{arxiv.2204.03062,
title = {Abusive and Threatening Language Detection in Urdu using Supervised Machine Learning and Feature Combinations},
author = {Muhammad Humayoun},
journal= {arXiv preprint arXiv:2204.03062},
year = {2022}
}
备注
Accepted in FIRE'21 (Track Abusive and Threatening Language Detection Task in Urdu). Forum for Information Retrieval Evaluation, December 13-17, 2021, India