中文

勿以恩人自居!面向弱势社群的 patronizing 与 condescending 语言标注数据集

计算与语言 2020-11-18 v1

摘要

在本文中,我们介绍一个新的标注数据集,旨在支持 NLP 模型识别并分类针对弱势社群(如难民、无家可归者、贫困家庭)的 patronizing 或 condescending 语言。尽管此类语言在大众媒体中的普遍存在早已被证明具有有害影响,但它不同于其他类型的有害语言,因为它通常是无意识且出于善意的。我们进一步认为,patronizing 与 condescending 语言(PCL)常具微妙特性,为 NLP 社群提出了有趣的技术挑战。我们对所提出数据集的分析表明,标准 NLP 模型难以识别 PCL,其中 BERT 等语言模型取得了最佳结果。

关键词

引用

@article{arxiv.2011.08320,
  title  = {Don't Patronize Me! An Annotated Dataset with Patronizing and Condescending Language towards Vulnerable Communities},
  author = {Carla Pérez-Almendros and Luis Espinosa-Anke and Steven Schockaert},
  journal= {arXiv preprint arXiv:2011.08320},
  year   = {2020}
}