中文

EXIST 2025 上的 Mario:面向有效多语言仇恨言论检测的简单门户

计算与语言 2025-07-16 v1

摘要

本文提出了我们的方法,用于 EXIST 2025 Task 1,解决英文和西班牙文推文中基于文本的仇恨言论检测问题。我们采用分层 Low-Rank Adaptation(LoRA)对 Llama 3.1 8B 进行微调。我们的方法引入条件适配器路由,显式建模三个层次结构子任务之间的标签依赖关系:二元仇恨言论识别、来源意图检测和多标签仇恨言论分类。与常规 LoRA 仅针对注意力层应用相比,我们将适配器应用于所有线性变换,增强模型捕获任务特定模式的能力。与复杂的数据处理和集成方法相比,我们表明简单的参数高效微调即可实现卓越的性能。我们使用统一的多语言训练,为每个子任务训练独立的 LoRA 适配器(rank=16,QLoRA 4-bit),利用 Llama 3.1 的原生双语能力。该方法需要最小的预处理,采用标准的监督学习。我们的多语言训练策略消除了对独立语言特定模型的需求,通过跨语言迁移实现 1.7-2.4% 的 F1 分数提升。仅使用 1.67% 的可训练参数相对于完整微调,训练时间缩短 75%,模型存储缩减 98%,同时在所有子任务上实现了有竞争力的性能(ICM-Hard: 0.6774 为二元分类,0.4991 为意图检测,0.6519 为多标签分类)。

关键词

引用

@article{arxiv.2507.10996,
  title  = {Mario at EXIST 2025: A Simple Gateway to Effective Multilingual Sexism Detection},
  author = {Lin Tian and Johanne R. Trippas and Marian-Andrei Rizoiu},
  journal= {arXiv preprint arXiv:2507.10996},
  year   = {2025}
}

备注

12 pages, 5 tables, CLEF 2025