针对 Twi 语的上下文文本嵌入
计算与语言
2021-04-01 v2 人工智能
摘要
基于 Transformer 的语言模型已经改变了英语、汉语、俄语等高资源语言的现代自然语言处理(NLP)格局。然而,该技术尚不存在于任何加纳语言。本文我们介绍了首个面向 Twi 语或 Akan 语(使用最广泛的加纳语言)的此类模型。本研究工作的具体贡献是开发了针对 Twi 语 Akuapem 和 Asante 方言的若干预训练 Transformer 语言模型,为命名实体识别(NER)、神经机器翻译(NMT)、情感分析(SA)和词性(POS)标注等应用领域的进展铺平道路。具体而言,我们引入了四种不同变体的 ABENA——A BERT model Now in Akan(现用于 Akan 语的 BERT 模型),其在一组 Akan 语语料上微调,以及 BAKO——仅含 Akan 知识的 BERT(BERT with Akan Knowledge only),其从零开始训练。我们通过 Hugging Face 模型中心开源该模型,并通过一个简单的情感分类示例演示其用法。
引用
@article{arxiv.2103.15963,
title = {Contextual Text Embeddings for Twi},
author = {Paul Azunre and Salomey Osei and Salomey Addo and Lawrence Asamoah Adu-Gyamfi and Stephen Moore and Bernard Adabankah and Bernard Opoku and Clara Asare-Nyarko and Samuel Nyarko and Cynthia Amoaba and Esther Dansoa Appiah and Felix Akwerh and Richard Nii Lante Lawson and Joel Budu and Emmanuel Debrah and Nana Boateng and Wisdom Ofori and Edwin Buabeng-Munkoh and Franklin Adjei and Isaac Kojo Essel Ampomah and Joseph Otoo and Reindorf Borkor and Standylove Birago Mensah and Lucien Mensah and Mark Amoako Marcel and Anokye Acheampong Amponsah and James Ben Hayfron-Acquah},
journal= {arXiv preprint arXiv:2103.15963},
year = {2021}
}
备注
10 pages paper; Accepted at African NLP Workshop @ EACL 2021