ToxiCloakCN:基于遮掩扰动评估中文仇恨语言检测的鲁棒性
计算与语言
2024-06-19 v1 计算机与社会
摘要
检测仇恨言论和冒犯性语言是维持安全尊重数字环境的关键。本研究考察了最新大型语言模型 (LLM) 在识别经系统性扰动数据中冒犯内容的局限性,聚焦中文这种语言易受此类扰动影响的特性。我们引入 \textsf{ToxiCloakCN},该数据集源自 ToxiCN,增添了同音字替换和 emoji 转换,用于测试 LLM 针对此类遮掩扰动的鲁棒性。我们的发现表明,现有模型在应用这些扰动后在识别冒犯内容方面表现显著下降。我们对不同类型的冒犯内容受这些扰动影响进行深入分析,并探讨了人类与模型对冒犯性的解释之间的对齐性。我们的工作凸显了在冒犯语言检测中亟需更高级技术的紧迫性,以对抗不断演变的规避检测机制的战术。
引用
@article{arxiv.2406.12223,
title = {ToxiCloakCN: Evaluating Robustness of Offensive Language Detection in Chinese with Cloaking Perturbations},
author = {Yunze Xiao and Yujia Hu and Kenny Tsu Wei Choo and Roy Ka-wei Lee},
journal= {arXiv preprint arXiv:2406.12223},
year = {2024}
}
备注
10 pages,5 Tables, 2 Figures