中文

面向广义跨语言仇恨语言检测:Web规模数据与智能体LLM注释

计算与语言 2026-04-14 v1

摘要

我们研究了大规模未标记网页数据和LLM生成注释是否能够提高多语言仇恨言语检测。我们从通过OpenWebSearch.eu~(OWS)爬取的四种语言(英语、德语、西班牙语、越南语)文本开始,采用两种互补策略。首先,我们通过继续在未标记的OWS文本上进行掩码语言建模来继续预训练BERT模型,然后在监督微调后,表明这在十六个基准测试中平均宏F1提升约3%,在低资源设置中获得更大的提升。其次,我们使用四个开源LLM(Mistral-7B、Llama3.1-8B、Gemma2-9B、Qwen2.5-14B)通过三种集成策略产生合成注释:均值平均、多数投票和LightGBM元学习器。LightGBM集成始终优于其他策略。在这些合成标签上进行微调对小模型(Llama3.2-1B:+11% pooled F1)提供了显著益处,但仅为更大模型的Qwen2.5-14B(+0.6%)提供了有限的提升。我们的结果表明,Web规模未标记数据和LLM集成注释的组合对小模型和低资源语言最为有价值。

关键词

引用

@article{arxiv.2604.09625,
  title  = {Toward Generalized Cross-Lingual Hateful Language Detection with Web-Scale Data and Ensemble LLM Annotations},
  author = {Dang H. Dang and Jelena Mitrovi and Michael Granitzer},
  journal= {arXiv preprint arXiv:2604.09625},
  year   = {2026}
}

备注

8 Pages, 3 tables, LREC 2026 papers