通过仇恨言论规范化主动降低在线帖子的仇恨强度
计算与语言
2022-06-09 v1
摘要
遏制在线仇恨言论已成为当务之急;然而,由于若干地缘政治和文化原因,对此类活动一概封禁并不可行。为缓解该问题的严重性,本文提出一项新任务——仇恨言论规范化(hate speech normalization),旨在削弱在线帖子所表现出的仇恨强度。仇恨言论规范化的意图并非支持仇恨,而是为用户提供迈向非仇恨的垫脚石,同时为在线平台争取更多时间来监控用户行为的任何改善。为此,我们人工整理了一个平行语料库——仇恨文本及其规范化对应文本(规范化文本仇恨更弱、更温和)。我们提出 NACL,一种简单而高效的仇恨言论规范化模型,分三阶段运行:首先度量原始样本的仇恨强度;其次识别其中的仇恨跨度(hate span);最后通过改写仇恨跨度来降低仇恨强度。我们通过三方评估(内在、外在和人工研究)进行了大量实验以衡量 NACL 的功效。我们观察到 NACL 优于六个基线——NACL 在强度预测上取得 0.1365 RMSE,在跨度识别上取得 0.622 F1-score,在规范化文本生成上取得 82.27 BLEU 和 80.05 perplexity。我们进一步展示了 NACL 跨其他平台(Reddit、Facebook、Gab)的泛化能力。为人工研究搭建了 NACL 的交互式原型。此外,该工具正作为 Wipro AI 应对在线平台有害内容使命的一部分,部署于真实场景。
引用
@article{arxiv.2206.04007,
title = {Proactively Reducing the Hate Intensity of Online Posts via Hate Speech Normalization},
author = {Sarah Masud and Manjot Bedi and Mohammad Aflah Khan and Md Shad Akhtar and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2206.04007},
year = {2022}
}
备注
11 pages, 4 figures, 12 tables. Accepted at KDD 2022 (ADS Track)