中文

自然语言处理研究中有害文本的处理与呈现

计算与语言 2023-02-28 v3

摘要

文本数据可能带来危害风险。然而,相关风险尚未被充分理解,如何以安全方式处理、呈现和讨论有害文本仍是 NLP 社区中一个未解决的问题。我们提供了一个分析框架,从三个轴对危害进行分类:(1) 危害类型(例如,错误信息、仇恨言论或种族刻板印象);(2) 若明确研究有害内容(例如,训练仇恨言论分类器),则该危害是作为研究设计特征被“主动寻求”的, versus 若在处理不相关问题(例如,语言生成或词性标注)时遇到有害内容,则该危害是“非主动寻求”的;(3) 受影响对象,从数据中(被)错误表征的人,到处理数据的人,再到发表相关数据的人。我们为从业者提供建议,并给出在研究与发表中减轻危害的具体步骤。为协助实施,我们引入了 \textsc{HarmCheck}——一种用于研究和呈现有害文本时的文档记录标准。

关键词

引用

@article{arxiv.2204.14256,
  title  = {Handling and Presenting Harmful Text in NLP Research},
  author = {Hannah Rose Kirk and Abeba Birhane and Bertie Vidgen and Leon Derczynski},
  journal= {arXiv preprint arXiv:2204.14256},
  year   = {2023}
}

备注

in Findings of EMNLP 2022