解释旗帜:超越审查的仇恨言论语境化
计算与语言
2026-04-17 v1
摘要
仇恨、侮辱和冒犯性言论仍是线上平台和公共话语中的持久挑战。虽然广泛使用的自动检测系统大多聚焦于审查或删除内容,但这引发了透明度和言论自由的担忧,限制了解释内容为何具有危害性的机会。为此,本文提出一种混合方法,结合大型语言模型 (LLM) 与三个新建并精选的词汇表,用于检测并解释英语、法语和希腊语中的仇恨言论。该系统通过两个互补的管道捕获与身份特征相关的固有侮辱表达以及针对特定群体的直接内容:一个使用精选词汇表检测并消除歧义的有问题术语,另一个利用 LLM 作为面向群体定位内容的语境敏感评估器。输出被融合为有依据的解释,以阐明为何标记该内容。人类评估表明,我们的混合方法准确且高质量解释优于仅使用 LLM 的基线方法。
引用
@article{arxiv.2604.14970,
title = {Explain the Flag: Contextualizing Hate Speech Beyond Censorship},
author = {Jason Liartis and Eirini Kaldeli and Lambrini Gyftokosta and Eleftherios Chelioudakis and Orfeas Menis Mastromichalakis},
journal= {arXiv preprint arXiv:2604.14970},
year = {2026}
}
备注
Accepted in the Findings of ACL 2026