中文

ToxiCloakCN:基于遮掩扰动评估中文仇恨语言检测的鲁棒性

计算与语言 2024-06-19 v1 计算机与社会

摘要

检测仇恨言论和冒犯性语言是维持安全尊重数字环境的关键。本研究考察了最新大型语言模型 (LLM) 在识别经系统性扰动数据中冒犯内容的局限性,聚焦中文这种语言易受此类扰动影响的特性。我们引入 \textsf{ToxiCloakCN},该数据集源自 ToxiCN,增添了同音字替换和 emoji 转换,用于测试 LLM 针对此类遮掩扰动的鲁棒性。我们的发现表明,现有模型在应用这些扰动后在识别冒犯内容方面表现显著下降。我们对不同类型的冒犯内容受这些扰动影响进行深入分析,并探讨了人类与模型对冒犯性的解释之间的对齐性。我们的工作凸显了在冒犯语言检测中亟需更高级技术的紧迫性,以对抗不断演变的规避检测机制的战术。

关键词

引用

@article{arxiv.2406.12223,
  title  = {ToxiCloakCN: Evaluating Robustness of Offensive Language Detection in Chinese with Cloaking Perturbations},
  author = {Yunze Xiao and Yujia Hu and Kenny Tsu Wei Choo and Roy Ka-wei Lee},
  journal= {arXiv preprint arXiv:2406.12223},
  year   = {2024}
}

备注

10 pages,5 Tables, 2 Figures