中文

具有可泛化目标感知公平性的仇恨言论检测

计算与语言 2024-06-12 v2 机器学习

摘要

为了应对社交媒体平台激增带来的副作用,仇恨言论检测(HSD)在早期阻止有毒在线帖子传播方面发挥着至关重要的作用。然而,鉴于社交媒体上普遍存在的主题社区,训练好的HSD分类器很容易偏向特定的目标群体(例如,女性和黑人),高比率的假阳性/假阴性结果会严重损害公众对内容审核机制公平性的信任,并最终损害在线社会的多样性。尽管现有的公平感知HSD方法可以消除目标群体之间的一些差异,但它们大多局限于一个狭窄的、假定已知且固定的目标选择。这不可避免地阻止了这些方法泛化到现实世界的用例,在这些用例中,新的目标群体不断出现。为了解决这个缺陷,我们提出了可泛化目标感知公平性(GetFair),一种用于在推理过程中对包含多样甚至未见目标群体的每个帖子进行公平分类的新方法。为了消除HSD分类器对目标相关特征的虚假依赖,GetFair在对抗性流程中训练一系列过滤函数,以欺骗从过滤后的帖子嵌入中恢复目标群体的判别器。为了保持可扩展性和泛化性,我们创新地通过一个由目标间语义亲和性正则化的超网络来参数化所有过滤函数。以目标的预训练词嵌入作为输入,超网络即时生成每个目标特定过滤器使用的权重,而无需存储专用的过滤器参数。最后,在两个HSD数据集上的对比实验显示了GetFair在样本外目标上的优越性能。

关键词

引用

@article{arxiv.2406.00046,
  title  = {Hate Speech Detection with Generalizable Target-aware Fairness},
  author = {Tong Chen and Danny Wang and Xurong Liang and Marten Risius and Gianluca Demartini and Hongzhi Yin},
  journal= {arXiv preprint arXiv:2406.00046},
  year   = {2024}
}

备注

To appear in KDD 2024