中文

自训练预训练语言模型用于零样本与少样本多方言阿拉伯语序列标注

计算与语言 2021-02-04 v4 人工智能 神经与进化计算

摘要

微调预训练语言模型用于下游任务通常需要足量标注数据。遗憾的是,获取标注数据可能代价高昂,尤其对于多种语言变体及方言而言。我们提出在零样本和少样本场景下自训练预训练语言模型,仅利用数据丰富变体的资源来提升数据稀缺变体的性能。我们以阿拉伯语序列标注为背景验证了方法效用:仅使用在现代标准阿拉伯语(MSA)上微调的语言模型,对多种方言阿拉伯语(DA)变体预测命名实体(NE)与词性(POS)标签。我们表明自训练确实强大,将零样本 MSA 到 DA 的迁移提升高达 \texttildelow 10% F1_1(NER)与 2% 准确率(POS 标注)。在有限标注数据的少样本场景下我们取得了更优性能。我们进行了消融研究,表明所观察到的性能提升直接源于用于自训练的未标注 DA 样本。我们的工作为仅利用 MSA 资源开发 DA 模型开辟了机会,并可推广至其他语言与任务。我们的代码与微调模型见 https://github.com/mohammadKhalifa/zero-shot-arabic-dialects。

关键词

引用

@article{arxiv.2101.04758,
  title  = {Self-Training Pre-Trained Language Models for Zero- and Few-Shot Multi-Dialectal Arabic Sequence Labeling},
  author = {Muhammad Khalifa and Muhammad Abdul-Mageed and Khaled Shaalan},
  journal= {arXiv preprint arXiv:2101.04758},
  year   = {2021}
}

备注

Accepted at EACL 2021 (Camera Ready Version)