基于道德论证的自解释仇恨言论检测
计算与语言
2026-01-08 v1
摘要
仇恨言论检测模型依赖表层词汇特征,增加了对虚假关联的脆弱性,限制了鲁棒性、文化语境化及可解释性。我们提出受监督道德论证注意力机制(SMRA),这是首个将道德论证作为直接监督信号用于注意力对齐的自解释仇恨言论检测框架。基于道德基础理论,SMRA将注意力对齐到专家标注的道德论证上,引导模型关注道德相关的文本片段而非虚假的词汇模式。不同于以往的论证监督或事后解释方法,SMRA将道德论证监督直接集成到训练目标中,产生内在可解释且具有语境化解释。为支持该框架,我们还引入HateBRMoralXplain——一个标注了仇恨标签、道德类别、token级道德论证及社会政治元数据的巴西葡萄牙语基准数据集。在二分类仇恨言论检测和多标签道德情感分类任务中,SMRA均实现性能提升(分别提升0.9和1.5分F1),同时显著增强解释忠诚度,IoU F1提升7.4个百分点,Token F1提升5.0个百分点。虽然解释更简洁,但充分性提升2.3个百分点,公平性保持稳定,表明在不牺牲性能或偏差的前提下获得更可靠的论证。
引用
@article{arxiv.2601.03481,
title = {Self-Explaining Hate Speech Detection with Moral Rationales},
author = {Francielle Vargas and Jackson Trager and Diego Alves and Surendrabikram Thapa and Matteo Guida and Berk Atil and Daryna Dementieva and Andrew Smart and Ameeta Agrawal},
journal= {arXiv preprint arXiv:2601.03481},
year = {2026}
}