中文

面向中资源语言的语境化词嵌入单语方法

计算与语言 2020-08-24 v2

摘要

我们使用从 Common Crawl 通过语言分类、过滤和清洗提取的多语 OSCAR 语料库,为五种中资源语言训练单语语境化词嵌入(ELMo)。随后,我们在词性标注和句法分析任务上比较这些语言基于 OSCAR 和基于 Wikipedia 的 ELMo 嵌入性能。我们表明,尽管基于 Common Crawl 的 OSCAR 数据存在噪声,在 OSCAR 上训练的嵌入表现远优于在 Wikipedia 上训练的单语嵌入。它们实际上等于或改进了所有五种语言在标注和分析任务上的当前 SOTA。特别地,它们也优于基于多语 Wikipedia 的语境化嵌入(multilingual BERT),而后者几乎总是构成此前的 SOTA,从而表明更大、更多样化语料库带来的收益超过了多语嵌入架构的跨语言收益。

关键词

引用

@article{arxiv.2006.06202,
  title  = {A Monolingual Approach to Contextualized Word Embeddings for Mid-Resource Languages},
  author = {Pedro Javier Ortiz Suárez and Laurent Romary and Benoît Sagot},
  journal= {arXiv preprint arXiv:2006.06202},
  year   = {2020}
}