中文

结合预训练高资源词嵌入与子词表示用于低资源语言

计算与语言 2020-04-22 v3 机器学习

摘要

当前自然语言处理(NLP)技术对大量数据的需求与数据匮乏之间的反差,在非洲语言中尤为突出,其中大多数被视为低资源语言。为帮助规避此问题,我们探索了利用形态丰富语言(MRLs)特性、同时借助资源充足语言中预训练词向量的技术。在我们的探索中,我们表明,结合预训练与形态知情词嵌入的元嵌入方法在科萨语-英语翻译这一下游任务中表现最佳。

关键词

引用

@article{arxiv.2003.04419,
  title  = {Combining Pretrained High-Resource Embeddings and Subword Representations for Low-Resource Languages},
  author = {Machel Reid and Edison Marrese-Taylor and Yutaka Matsuo},
  journal= {arXiv preprint arXiv:2003.04419},
  year   = {2020}
}

备注

Accepted to the "AfricaNLP - Unlocking Local Languages" workshop at ICLR 2020