中文

AmpleHate:放大注意力以实现多用途的隐式仇恨检测

计算与语言 2025-09-22 v3 人工智能 计算机与社会

摘要

隐式仇恨言论检测具有挑战性,因为其具有微妙性且依赖上下文解释,而非明确的冒犯性词汇。当前方法依赖对比学习,这在区分仇恨和非仇恨句子方面已被证明是有效的。然而,人类检测隐式仇恨言论时,首先识别文本中的特定目标,随后解释这些目标如何与其周围上下文相关联。受此推理过程启发,我们提出了 AmpleHate,一种旨在模拟人类推理进行隐式仇恨检测的新方法。AmpleHate 使用预训练的命名实体识别模型识别显式目标,并通过 [CLS] token 捕获隐式目标信息。它计算显式目标、隐式目标与句子上下文之间基于注意力的关系,然后直接将这些关系向量注入最终的句子表示中。这放大了用于判定隐式仇恨的目标-上下文关系的关键信号。实验表明,AmpleHate 实现了 SOTA 性能,平均超过对比学习基线 82.14%,并且收敛更快。定性分析进一步表明,AmpleHate 产生的注意力模式与人类判断高度一致,凸显了其可解释性和鲁棒性。我们的代码公开于:https://github.com/leeyejin1231/AmpleHate。

关键词

引用

@article{arxiv.2505.19528,
  title  = {AmpleHate: Amplifying the Attention for Versatile Implicit Hate Detection},
  author = {Yejin Lee and Joonghyuk Hahn and Hyeseon Ahn and Yo-Sub Han},
  journal= {arXiv preprint arXiv:2505.19528},
  year   = {2025}
}

备注

13 pages, 4 figures, EMNLP 2025