无法区分使用与提及的NLP系统会审查反言论,但教授这一区别有助于改善
计算与语言
2024-04-03 v1 计算机与社会
人机交互
社会与信息网络
摘要
词语用于传达说话者意图的传统用法与“提及”(引用某人所说的话或指出词语属性)有所区别。本文表明,对这种使用-提及区别的计算建模对于处理在线反言论至关重要。反驳有问题内容的反言论通常提及有害语言,但其本身并不有害(例如,称疫苗危险与表达对某人称疫苗危险的不满不同)。我们表明,即使是最近的语言模型也无法区分使用和提及,并且这种失败会传播到两个关键的下游任务:错误信息和仇恨言论检测,导致对反言论的审查。我们引入了提示缓解措施,教授使用-提及区别,并表明这些措施减少了这些错误。我们的工作强调了使用-提及区别对NLP和计算社会科学的重要性,并提供了解决该问题的方法。
引用
@article{arxiv.2404.01651,
title = {NLP Systems That Can't Tell Use from Mention Censor Counterspeech, but Teaching the Distinction Helps},
author = {Kristina Gligoric and Myra Cheng and Lucia Zheng and Esin Durmus and Dan Jurafsky},
journal= {arXiv preprint arXiv:2404.01651},
year = {2024}
}
备注
NAACL 2024 (Main conference)