超越谴责仇恨:应对语言中隐含偏见与刻板印象的策略
计算与语言
2023-11-02 v1 人工智能
摘要
反言语(counterspeech),即用以抵消仇恨言论潜在危害的回应,已成为一种日益流行的、在不审查前提下应对网络仇恨言论的方案。然而,恰当反击仇恨性语言需要反驳并消除此类语言所隐含的失实刻板印象。本工作中,我们借鉴心理学与哲学文献,精心构建六种受心理学启发的策略,以挑战仇恨性语言底层的刻板印象意涵。我们首先通过用户研究考察各策略的说服力,继而比较其与人类及机器生成的反言语数据集中的使用情形。结果显示,人类撰写之反言语采用更针对隐含刻板印象的策略(如针对刻板印象的反例、关于刻板印象起源的外部因素),而机器生成之反言语采用较不特定的策略(如泛泛谴责言论之可憎)。此外,机器生成的反言语常采用相较人类产物而言人类认为较不具说服力的策略。我们的发现指出,在生成反言语时考量言语底层刻板印象意涵、以及增进机器对反刻板印象例子的推理能力之重要性。
引用
@article{arxiv.2311.00161,
title = {Beyond Denouncing Hate: Strategies for Countering Implied Biases and Stereotypes in Language},
author = {Jimin Mun and Emily Allaway and Akhila Yerukola and Laura Vianna and Sarah-Jane Leslie and Maarten Sap},
journal= {arXiv preprint arXiv:2311.00161},
year = {2023}
}
备注
EMNLP 2023 Findings, 19 pages