将注意力对齐人类理由,用于自解释型仇恨言论检测
计算与语言
2025-11-11 v1 机器学习
摘要
深度学习模型的不可解释性质对于伦理地部署仇恨言论检测系统构成了重大挑战。为此,我们引入一种监督注意力机制(SRA),显式地将模型注意力与人类理由对齐,从而在仇恨言论分类中提高可解释性和公平性。SRA 将监督注意力机制集成到基于 Transformer 的分类器中,优化目标组合包括标准分类损失和对齐损失项,后者最小化注意力权重与人类标注理由之间的差异。我们在英语(HateXplain)和葡萄牙语(HateBRXplain)上的仇恨言论基准数据集上评估了 SRA。经验结果表明,SRA 在可解释性方面比当前基线方法高出 2.4 倍,产生的 token 级解释更具忠实性和人类对齐性。在公平性方面,SRA 在所有公平性度量指标上都取得了竞争的表现,在检测针对身份群体的有毒帖子方面成绩位居第二,同时在其他指标上保持与当前方法相当的表现。这些发现表明,将人类理由纳入注意力机制可以提升可解释性和忠实性,而不会损害公平性。
引用
@article{arxiv.2511.07065,
title = {Aligning Attention with Human Rationales for Self-Explaining Hate Speech Detection},
author = {Brage Eilertsen and Røskva Bjørgfinsdóttir and Francielle Vargas and Ali Ramezani-Kebrya},
journal= {arXiv preprint arXiv:2511.07065},
year = {2025}
}
备注
Accepted at the Annual AAAI Conference on Artificial Intelligence (AAAI26)