结合预训练高资源词嵌入与子词表示用于低资源语言
计算与语言
2020-04-22 v3 机器学习
摘要
当前自然语言处理(NLP)技术对大量数据的需求与数据匮乏之间的反差,在非洲语言中尤为突出,其中大多数被视为低资源语言。为帮助规避此问题,我们探索了利用形态丰富语言(MRLs)特性、同时借助资源充足语言中预训练词向量的技术。在我们的探索中,我们表明,结合预训练与形态知情词嵌入的元嵌入方法在科萨语-英语翻译这一下游任务中表现最佳。
引用
@article{arxiv.2003.04419,
title = {Combining Pretrained High-Resource Embeddings and Subword Representations for Low-Resource Languages},
author = {Machel Reid and Edison Marrese-Taylor and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2003.04419},
year = {2020}
}
备注
Accepted to the "AfricaNLP - Unlocking Local Languages" workshop at ICLR 2020