中文

面向广义冒犯语言识别

计算与语言 2024-07-29 v1 人工智能

摘要

互联网上包含仇恨言语和网络欺凌的冒犯内容在全球范围内广泛存在,这引起了机器学习 (ML) 和自然语言处理 (NLP) 社区的广泛关注。因此,已开发出诸多系统来自动识别潜在有害内容并减轻其影响。这些系统可遵循两种方法:(1) 使用公开模型和应用程序端点,包括调用大型语言模型 (LLM);(2) 标注数据集并在其上训练 ML 模型。然而,这两种方法都缺乏对其通用性的理解。此外,这些系统的适用性常在域外和实际环境中受到质疑。本文在一个新颖的广义基准测试中经验性地评估了冒犯语言检测模型和数据集的通用性。我们对通用性提出三个研究问题。我们的发现对创建稳健的实际冒犯语言检测系统有益。

关键词

引用

@article{arxiv.2407.18738,
  title  = {Towards Generalized Offensive Language Identification},
  author = {Alphaeus Dmonte and Tejas Arya and Tharindu Ranasinghe and Marcos Zampieri},
  journal= {arXiv preprint arXiv:2407.18738},
  year   = {2024}
}

备注

Accepted to ASONAM 2024