中文

面向隐式仇恨检测的聚焦推理注入与可处理密度判别耦合方法

计算与语言 2026-03-04 v2 计算机与社会

摘要

尽管预训练大语言模型(PLMs)已在许多自然语言处理(NLP)任务上取得最先进水平,但它们缺乏对隐式仇恨言论微妙表达的理解。已有多种尝试通过增强外部上下文或基于距离的度量强制标签分离来提升隐式仇恨的检测。结合这两种方法,我们提出了 FiADD,一种新颖的聚焦推理自适应密度判别(Focused Inferential Adaptive Density Discrimination)框架。FiADD 通过将隐式仇恨言论的表层形式/意义拉近其隐含形式,同时增大各类标签间的簇间距离,来增强 PLM 微调流程。我们在三个隐式仇恨数据集上测试 FiADD,并在二分类和三分类仇恨分类任务中观察到显著提升。我们进一步在另外三个任务(检测讽刺、反讽和立场,其表层与隐含形式不同)上实验了 FiADD 的泛化性,并观察到类似的性能提升。最后,我们分析生成的潜在空间以理解其在 FiADD 下的演化,这印证了采用 FiADD 进行隐式仇恨言论检测的优势。

关键词

引用

@article{arxiv.2309.11896,
  title  = {Focal Inferential Infusion Coupled with Tractable Density Discrimination for Implicit Hate Detection},
  author = {Sarah Masud and Ashutosh Bajpai and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2309.11896},
  year   = {2026}
}

备注

23 pages, 6 Figures, 9 Tables. Accepted at NLE