中文

UMass PCL 在 SemEval-2022 任务 4:用于检测 patronizing and condescending language 的预训练语言模型集成

计算与语言 2022-04-19 v1

摘要

Patronizing and condescending language(PCL,居高临下且贬损性语言)无处不在,但鲜有关注媒体对弱势群体的此类使用。由于标注数据有限且语言可能十分微妙,准确检测此种形式的 PCL 是一项困难任务。本文描述了我们提交至 SemEval 2022 任务 4(Patronizing and Condescending Language Detection,居高临下且贬损性语言检测)的用于检测此类语言的系统。我们的方法使用预训练语言模型集成、数据增强以及检测阈值的优化。在竞赛主办方发布的评估数据集上的实验结果表明,我们的工作能可靠地检测 PCL,在二分类任务上取得 55.47% 的 F1 分数,在细粒度多标签检测任务上取得 36.25% 的宏 F1 分数。

关键词

引用

@article{arxiv.2204.08304,
  title  = {UMass PCL at SemEval-2022 Task 4: Pre-trained Language Model Ensembles for Detecting Patronizing and Condescending Language},
  author = {David Koleczek and Alex Scarlatos and Siddha Karakare and Preshma Linet Pereira},
  journal= {arXiv preprint arXiv:2204.08304},
  year   = {2022}
}

备注

9 pages, 1 figure, accepted to SemEval 2022 Task 4