MasakhaNER 2.0:面向非洲语言的命名实体识别迁移学习
计算与语言
2022-11-17 v2
摘要
非洲语言由超过十亿人使用,但在 NLP 研究与开发中代表性不足。阻碍进展的挑战包括标注数据集的有限可用性,以及对当前方法有效设置缺乏理解。在本文中,我们针对这些挑战取得进展,聚焦于命名实体识别(NER)任务。我们创建了涵盖 20 种非洲语言的最大人工标注 NER 数据集,并研究了以非洲为中心设置下最先进的跨语言迁移方法的行为,表明源语言的选择显著影响性能。我们展示,与使用英语相比,选择最佳迁移语言使 20 种语言的零样本 F1 分数平均提高 14 个点。我们的结果凸显了覆盖类型学多样非洲语言的基准数据集与模型的必要性。
引用
@article{arxiv.2210.12391,
title = {MasakhaNER 2.0: Africa-centric Transfer Learning for Named Entity Recognition},
author = {David Ifeoluwa Adelani and Graham Neubig and Sebastian Ruder and Shruti Rijhwani and Michael Beukman and Chester Palen-Michel and Constantine Lignos and Jesujoba O. Alabi and Shamsuddeen H. Muhammad and Peter Nabende and Cheikh M. Bamba Dione and Andiswa Bukula and Rooweither Mabuya and Bonaventure F. P. Dossou and Blessing Sibanda and Happy Buzaaba and Jonathan Mukiibi and Godson Kalipe and Derguene Mbaye and Amelia Taylor and Fatoumata Kabore and Chris Chinenye Emezue and Anuoluwapo Aremu and Perez Ogayo and Catherine Gitau and Edwin Munkoh-Buabeng and Victoire M. Koagne and Allahsera Auguste Tapo and Tebogo Macucwa and Vukosi Marivate and Elvis Mboning and Tajuddeen Gwadabe and Tosin Adewumi and Orevaoghene Ahia and Joyce Nakatumba-Nabende and Neo L. Mokono and Ignatius Ezeani and Chiamaka Chukwuneke and Mofetoluwa Adeyemi and Gilles Q. Hacheme and Idris Abdulmumin and Odunayo Ogundepo and Oreen Yousuf and Tatiana Moteu Ngoli and Dietrich Klakow},
journal= {arXiv preprint arXiv:2210.12391},
year = {2022}
}
备注
Accepted to EMNLP 2022 (updated Github link)