COLD:一个中文攻击性语言检测基准
计算与语言
2022-10-20 v2 人工智能
摘要
攻击性语言检测对于维护文明的社会媒体平台与部署预训练语言模型日益重要。然而,由于可靠数据集的匮乏,这一任务在中文中仍处于探索阶段。为此,我们提出一个用于中文攻击性语言分析的基准——COLD,包括一个中文攻击性语言数据集——COLDATASET,以及一个在该数据集上训练的基础检测器——COLDETECTOR。我们表明COLD基准有助于中文攻击性语言检测,而这对现有资源而言具有挑战性。随后我们部署COLDETECTOR并对流行的中文预训练语言模型进行详细分析。我们首先分析现有生成模型的攻击性,表明这些模型不可避免地暴露出不同程度的攻击性问题。此外,我们探究了影响攻击性生成的因素,发现反偏见内容以及指代特定群体或流露负面态度的关键词更容易触发攻击性输出。
引用
@article{arxiv.2201.06025,
title = {COLD: A Benchmark for Chinese Offensive Language Detection},
author = {Jiawen Deng and Jingyan Zhou and Hao Sun and Chujie Zheng and Fei Mi and Helen Meng and Minlie Huang},
journal= {arXiv preprint arXiv:2201.06025},
year = {2022}
}
备注
19 pages