中文

AIWizards 在 MULTIPRIDE 中的方案:针对蔑称复辟检测的层次化方法

计算与语言 2026-02-16 v1

摘要

检测被复辟的蔑称代表了仇恨言论检测系统的一个根本性挑战,因为相同的词汇条目可以在社会身份和语境不同的情况下,既表现为侮辱性表达,也表现为同伴间的肯定。在本工作中,我们针对 MultiPRIDE 2026 年 EVALITA 共享任务的子任务 B 提出了一种层次化方法来建模蔑称复辟过程。我们的核心假设是,LGBTQ+ 社区成员更可能以惊讶的方式使用某些蔑称。基于此假设,我们将任务分解为两个阶段。首先,使用基于大语言模型的弱监督标注,我们为用户分配模糊标签,指示其是否属于 LGBTQ+ 社区的可能性,这是从推文和用户简介中推断得出的。这些软标签随后用于训练 BERT 类模型以预测社区成员身份,以鼓励模型学习与 LGBTQ+ 身份相关的潜在表征。在第二个阶段,我们将这个潜在空间与用于下游蔑称复辟检测任务的新初始化模型集成。直观认为,第一个模型编码了用户导向的社会语言学信号,这些信号随后与为仇恨言论检测预训练的模型所学习的表征融合。在意大利语和西班牙语上的实验结果表明,我们的方法的性能与强大的 BERT 基线相当,而且提供了一个模块化可扩展的框架,用于将社会语言学背景纳入仇恨言论建模。我们认为,更细致的层次化建模用户身份和话语背景可能会进一步提高对复辟语言的检测。我们在 https://github.com/LucaTedeschini/multipride 上发布了代码。

关键词

引用

@article{arxiv.2602.12818,
  title  = {AIWizards at MULTIPRIDE: A Hierarchical Approach to Slur Reclamation Detection},
  author = {Luca Tedeschini and Matteo Fasulo},
  journal= {arXiv preprint arXiv:2602.12818},
  year   = {2026}
}