中文

课程学习与伪标签提高多标签阿拉伯方言识别模型泛化能力

计算与语言 2026-02-18 v2 机器学习

摘要

长期以来,阿拉伯方言识别(ADI)被建模为单标签分类任务。最近的工作认为ADI应被建模为多标签分类任务。然而,ADI仍受限于单标签数据集的可用性,缺乏大规模的多标签资源用于训练。通过分析在单标签ADI数据上训练的模型,我们表明,将此类数据集重新用于多标签阿拉伯方言识别(MLADI)的主要困难在于负样本的选择,因为许多被视为负样本的句子在多个方言中都可能是可接受的。为此,我们通过生成自动的多标签注释,使用GPT-4o和二进制方言可接受性分类器,结合阿拉伯方言程度(ALDi)进行聚合,构建了一个多标签数据集。随后,我们采用与方言复杂度和标签基数相关的课程学习策略训练一个基于BERT的多标签分类器。在MLADI排行榜上,我们最佳的 LAHJATBERT 模型实现了宏平均F1得分0.69,而最佳之前报告系统的得分为0.55。代码和数据可在 https://mohamedalaa9.github.io/lahjatbert/ 获取。

关键词

引用

@article{arxiv.2602.12937,
  title  = {Curriculum Learning and Pseudo-Labeling Improve the Generalization of Multi-Label Arabic Dialect Identification Models},
  author = {Ali Mekky and Mohamed El Zeftawy and Lara Hassan and Amr Keleg and Preslav Nakov},
  journal= {arXiv preprint arXiv:2602.12937},
  year   = {2026}
}

备注

Accepted at the 13th Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial), co-located with EACL 2026