面向中资源语言的语境化词嵌入单语方法
计算与语言
2020-08-24 v2
摘要
我们使用从 Common Crawl 通过语言分类、过滤和清洗提取的多语 OSCAR 语料库,为五种中资源语言训练单语语境化词嵌入(ELMo)。随后,我们在词性标注和句法分析任务上比较这些语言基于 OSCAR 和基于 Wikipedia 的 ELMo 嵌入性能。我们表明,尽管基于 Common Crawl 的 OSCAR 数据存在噪声,在 OSCAR 上训练的嵌入表现远优于在 Wikipedia 上训练的单语嵌入。它们实际上等于或改进了所有五种语言在标注和分析任务上的当前 SOTA。特别地,它们也优于基于多语 Wikipedia 的语境化嵌入(multilingual BERT),而后者几乎总是构成此前的 SOTA,从而表明更大、更多样化语料库带来的收益超过了多语嵌入架构的跨语言收益。
引用
@article{arxiv.2006.06202,
title = {A Monolingual Approach to Contextualized Word Embeddings for Mid-Resource Languages},
author = {Pedro Javier Ortiz Suárez and Laurent Romary and Benoît Sagot},
journal= {arXiv preprint arXiv:2006.06202},
year = {2020}
}