中文

SOLD:僧伽罗语攻击性语言数据集

计算与语言 2024-03-29 v2 人工智能 机器学习 社会与信息网络

摘要

攻击性内容(如仇恨言论与网络欺凌)在网上的泛滥是一种全球现象。这引发了人工智能(AI)与自然语言处理(NLP)领域的兴趣,推动了各类旨在自动检测潜在有害内容的系统的开发。这些系统需要带标注的数据集来训练机器学习(ML)模型。然而,除少数显著例外,该主题下大多数数据集都针对英语及少数其他高资源语言。因此,攻击性语言识别的研究仅限于这些语言。本文通过解决僧伽罗语这一斯里兰卡超过 1700 万人使用的低资源印度-雅利安语言的攻击性语言识别问题,来弥补这一缺口。我们引入了僧伽罗语攻击性语言数据集(SOLD),并给出了在该数据集上的多项实验。SOLD 是一个人工标注的数据集,包含来自 Twitter 的 10,000 条帖子,在句子级与词元级均标注为攻击性与非攻击性,从而提升了 ML 模型的可解释性。SOLD 是首个公开可用的、为僧伽罗语编制的大规模攻击性语言数据集。我们还引入了 SemiSOLD,一个包含超过 145,000 条僧伽罗语推文、依半监督方法标注的更大数据集。

关键词

引用

@article{arxiv.2212.00851,
  title  = {SOLD: Sinhala Offensive Language Dataset},
  author = {Tharindu Ranasinghe and Isuri Anuradha and Damith Premasiri and Kanishka Silva and Hansi Hettiarachchi and Lasitha Uyangodage and Marcos Zampieri},
  journal= {arXiv preprint arXiv:2212.00851},
  year   = {2024}
}

备注

Accepted to Language Resources and Evaluation, Springer