COBRA框架:关于攻击性言论影响与危害的语境推理
计算与语言
2023-06-12 v2
摘要
警告:本文包含可能令人不适或受到冒犯的内容。理解言论的危害与攻击性需要对其发表的社会与情境语境进行推理。例如,“你的英语很好”这句话,当一名白人男性对一位非白人同事说时,可能隐含侮辱意味,但若由ESL教师对学生说则会被解读为真诚的赞美。此类语境因素在以往的毒性语言检测方法中基本被忽略。我们提出COBRA框架,这是首个基于社会与情境语境解释攻击性或偏见性言论的意图、反应与危害的语境感知形式体系。我们创建了COBRACORPUS,一个包含33k条潜在攻击性言论的数据集,每条配有机生成语境及关于攻击性、隐含偏见、说话者意图与听者反应的自然语言解释。为研究攻击性的语境动态,我们训练了有/无语境接入的模型来生成COBRA解释。我们发现,无语境模型的解释明显劣于语境感知模型,尤其在语境反转言论攻击性的情形下(准确率下降29%)。我们的工作通过建模社会因素,凸显了语境化NLP的重要性和可行性。
引用
@article{arxiv.2306.01985,
title = {COBRA Frames: Contextual Reasoning about Effects and Harms of Offensive Statements},
author = {Xuhui Zhou and Hao Zhu and Akhila Yerukola and Thomas Davidson and Jena D. Hwang and Swabha Swayamdipta and Maarten Sap},
journal= {arXiv preprint arXiv:2306.01985},
year = {2023}
}
备注
Accepted to Findings of ACL 2023