面向公共论坛中具法律可执行性的仇恨言论检测
计算与语言
2023-11-03 v2
摘要
仇恨言论引发广泛且根深蒂固的社会问题。妥善执行仇恨言论法律是保护群体免受有害和歧视性语言侵害的关键。然而,判定何为仇恨言论是一项复杂任务,极易受主观解释影响。现有工作未将其系统与可强制执行的仇恨言论定义对齐,这可能导致其输出与监管者目标不一致。本研究引入了一种以法律定义为核心的、可强制执行仇恨言论检测的新视角与任务,以及一个由法律专家基于十一种可能定义的违规情况标注的数据集。鉴于识别清晰、法律上可强制执行的仇恨言论实例的挑战,我们用专家生成的样本和一个自动挖掘的困难集扩充了该数据集。我们尝试使用零样本和少样本提示将这些定义作为模型决策的依据。随后我们报告了若干大语言模型(LLMs)上的结果。借助此任务定义,自动仇恨言论检测可更紧密地对齐可执行法律,从而协助对公共论坛中有害言论的法律保护进行更严格的执行。
引用
@article{arxiv.2305.13677,
title = {Towards Legally Enforceable Hate Speech Detection for Public Forums},
author = {Chu Fei Luo and Rohan Bhambhoria and Xiaodan Zhu and Samuel Dahan},
journal= {arXiv preprint arXiv:2305.13677},
year = {2023}
}
备注
8 pages; Accepted to the Findings of EMNLP 2023