HatePrototypes:用于隐式和显式仇恨言论检测的可解释且可迁移的表示
计算与语言
2026-04-07 v3 人工智能
摘要
针对不同类型的仇恨言论信息素化,通常通过持续预训练或在新仇恨言论基准数据集上进行微调来实现。然而,现有基准数据集主要关注针对受保护群体的显性仇恨,往往忽略隐式或间接性仇恨,如贬低性比较、排斥或暴力呼声,以及仍造成伤害的微妙歧视性语言。虽然显性仇恨常通过表面特征捕获,但隐式仇恨需要更深入的、全模型语义处理。本文质疑反复微调的必要性,分析了 HatePrototypes——从为仇恨言论检测和安全内容审核优化的语言模型中导出的类别级向量表示在中的作用。我们发现,这些原型(仅需每类 50 个样本)即可实现显性与隐式仇恨之间的跨任务迁移,原型在不同基准数据集间可互换使用。此外,我们表明参数无关的早期退出结合原型对两种仇恨类型都有效。我们公开代码、原型资源和评估脚本,以支持未来研究高效且可迁移的仇恨言论检测。
引用
@article{arxiv.2511.06391,
title = {HatePrototypes: Interpretable and Transferable Representations for Implicit and Explicit Hate Speech Detection},
author = {Irina Proskurina and Marc-Antoine Carpentier and Julien Velcin},
journal= {arXiv preprint arXiv:2511.06391},
year = {2026}
}