中文

揭示印度选举竞选中的政治仇恨言论:一个新的低资源数据集与基线

计算与语言 2023-06-29 v2

摘要

政治话语中仇恨言论的检测是一个关键问题,而在低资源语言中这一问题更具挑战性。为解决此问题,我们引入了一个名为 IEHate 的新数据集,其中包含 11,457 条手动标注的、与 2021 年 11 月 1 日至 2022 年 3 月 9 日印度邦议会选举竞选相关印地语推文。我们对数据集进行了详细分析,重点关注政治传播中仇恨言论的普遍程度以及所使用的不同形式仇恨性语言。此外,我们使用一系列机器学习、深度学习和基于 transformer 的算法对该数据集进行了基准测试。我们的实验表明,这些模型的性能仍有进一步提升空间,凸显了针对低资源语言仇恨言论检测开发更先进技术的必要性。特别是,人工评估相对于算法的较高分数强调了将人工与自动化方法结合用于有效仇恨言论审核的重要性。我们的 IEHate 数据集可作为从事低资源语言仇恨言论检测技术开发与评估的研究人员和从业者的宝贵资源。总体而言,我们的工作强调了解决政治话语中识别与缓解仇恨言论挑战的重要性,尤其是在低资源语言背景下。本工作的数据集与资源发布于 https://github.com/Farhan-jafri/Indian-Election。

关键词

引用

@article{arxiv.2306.14764,
  title  = {Uncovering Political Hate Speech During Indian Election Campaign: A New Low-Resource Dataset and Baselines},
  author = {Farhan Ahmad Jafri and Mohammad Aman Siddiqui and Surendrabikram Thapa and Kritesh Rauniyar and Usman Naseem and Imran Razzak},
  journal= {arXiv preprint arXiv:2306.14764},
  year   = {2023}
}

备注

Accepted to ICWSM Workshop (MEDIATE)