中文

无法区分使用与提及的NLP系统会审查反言论,但教授这一区别有助于改善

计算与语言 2024-04-03 v1 计算机与社会 人机交互 社会与信息网络

摘要

词语用于传达说话者意图的传统用法与“提及”(引用某人所说的话或指出词语属性)有所区别。本文表明,对这种使用-提及区别的计算建模对于处理在线反言论至关重要。反驳有问题内容的反言论通常提及有害语言,但其本身并不有害(例如,称疫苗危险与表达对某人称疫苗危险的不满不同)。我们表明,即使是最近的语言模型也无法区分使用和提及,并且这种失败会传播到两个关键的下游任务:错误信息和仇恨言论检测,导致对反言论的审查。我们引入了提示缓解措施,教授使用-提及区别,并表明这些措施减少了这些错误。我们的工作强调了使用-提及区别对NLP和计算社会科学的重要性,并提供了解决该问题的方法。

关键词

引用

@article{arxiv.2404.01651,
  title  = {NLP Systems That Can't Tell Use from Mention Censor Counterspeech, but Teaching the Distinction Helps},
  author = {Kristina Gligoric and Myra Cheng and Lucia Zheng and Esin Durmus and Dan Jurafsky},
  journal= {arXiv preprint arXiv:2404.01651},
  year   = {2024}
}

备注

NAACL 2024 (Main conference)