KBCNMUJAL@HASOC-Dravidian-CodeMix-FIRE2020: 利用机器学习检测仇恨言论与攻击性混合代码社交媒体文本
计算与语言
2021-02-22 v1 机器学习
摘要
本文描述了我们的团队 KBCNMUJAL 为 2020 年 12 月 16-20 日在印度海得拉巴举行的信息检索评价论坛(FIRE)上 HASOC 共享任务“印欧语言中的仇恨言论与攻击性内容识别”的任务 2 所提交的系统。HASOC 组织者分享了两种达罗毗荼语言即 Malayalam 和 Tamil 的数据集,各含 4000 条观测。这些数据集用于基于分类与回归模型的不同机器学习算法训练机器。数据集由推文或 YouTube 评论组成,带有两个类别标签:攻击性与非攻击性。机器被训练将此类社交媒体消息分类为这两类。提取了适当的 n-gram 特征集以学习仇恨言论文本消息的特定特征。这些特征模型基于 n-gram 的 TFIDF 权重。所述工作及相应实验表明,词、字符以及词与字符 n-gram 的组合模型等特征可用于识别攻击性文本内容的术语模式。作为 HASOC 共享任务的一部分,测试数据集由 HASOC 赛道组织者提供。为两种语言开发的最佳分类模型被应用于测试数据集。在 Malayalam 语言训练集上取得最高准确率的模型被用于预测相应测试数据的类别。该系统获得了 0.77 的 F1 分数。类似地,Tamil 语言的最佳模型获得了 0.87 的 F1 分数。本工作在共享任务 2 的 Malayalam 和 Tamil 语言中分别获得第 2 和第 3 名。所提出的系统命名为 HASOC_kbcnmujal。
引用
@article{arxiv.2102.09866,
title = {KBCNMUJAL@HASOC-Dravidian-CodeMix-FIRE2020: Using Machine Learning for Detection of Hate Speech and Offensive Code-Mixed Social Media text},
author = {Varsha Pathak and Manish Joshi and Prasad Joshi and Monica Mundada and Tanmay Joshi},
journal= {arXiv preprint arXiv:2102.09866},
year = {2021}
}