仇恨无法驱散仇恨:预测仇恨言论回复后的对话不文明程度
计算机与社会
2023-12-11 v1 计算与语言
摘要
用户生成的仇恨言论回复是对抗仇恨的有力手段,但关于它们能否阻止后续对话中的不文明行为仍存疑问。我们认为,有效的回复应能阻止后续对话中出现不文明行为——引发更多不文明行为的回复则适得其反。本研究引入了预测仇恨言论回复后对话不文明程度的任务。我们首先提出一种基于文明与不文明评论数量以及参与讨论的独立作者数量的度量标准,用以衡量对话不文明程度。该度量标准比以往指标更准确地近似人类判断。随后,我们使用该度量标准评估仇恨言论回复的结果。语言分析揭示了引发高不文明程度和低不文明程度后续对话的回复在语言上的差异。实验结果表明,预测不文明程度具有挑战性。最后,我们通过定性分析揭示了最佳模型最常见的错误类型。
引用
@article{arxiv.2312.04804,
title = {Hate Cannot Drive out Hate: Forecasting Conversation Incivility following Replies to Hate Speech},
author = {Xinchen Yu and Eduardo Blanco and Lingzi Hong},
journal= {arXiv preprint arXiv:2312.04804},
year = {2023}
}
备注
The 18th International AAAI Conference on Web and Social Media (ICWSM 2024) Accepted