基于监督机器学习与特征组合的 2021 乌尔都语假新闻检测任务
计算与语言
2022-04-08 v1
摘要
本文介绍了提交至 FIRE 共享任务“2021 乌尔都语假新闻检测”的系统描述。该挑战旨在自动识别用乌尔都语撰写的假新闻。我们的提交结果在竞赛中排名第五。然而,在竞赛结果公布后,我们取得了比提交结果更好的成绩。我们的一个模型所取得的最佳 F1 Macro 分数为 0.6674,高于竞赛中的第二名分数。该结果是在支持向量机(多项式核,阶数 1)上取得的,采用了去除停用词、应用词形还原,并从总计 1.557 百万个特征(由词 n-gram n=1,2,3,4 和字符 n-gram n=2,3,4,5,6 生成)中选出 2 万最佳特征。代码已公开以保证可复现性。
引用
@article{arxiv.2204.03064,
title = {The 2021 Urdu Fake News Detection Task using Supervised Machine Learning and Feature Combinations},
author = {Muhammad Humayoun},
journal= {arXiv preprint arXiv:2204.03064},
year = {2022}
}
备注
Accepted in FIRE'21 (Track Abusive and Threatening Language Detection Task in Urdu). Forum for Information Retrieval Evaluation, December 13-17, 2021, India