面向七种低资源语言的高质量 ELMo 嵌入
计算与语言
2022-06-01 v2 机器学习
摘要
近期结果表明,使用上下文嵌入的深度神经网络在绝大多数文本分类任务上显著优于非上下文嵌入。我们为七种语言提供了来自流行上下文 ELMo 模型的预计算嵌入:克罗地亚语、爱沙尼亚语、芬兰语、拉脱维亚语、立陶宛语、斯洛文尼亚语和瑞典语。我们证明了嵌入质量强烈依赖于训练集规模,并指出现有公开可用的上述语言的 ELMo 嵌入仍有改进空间。我们在大得多的训练集上训练了新的 ELMo 嵌入,并展示了它们相对于基线非上下文 FastText 嵌入的优势。在评估中,我们使用了两个基准:类比任务和 NER 任务。
引用
@article{arxiv.1911.10049,
title = {High Quality ELMo Embeddings for Seven Less-Resourced Languages},
author = {Matej Ulčar and Marko Robnik-Šikonja},
journal= {arXiv preprint arXiv:1911.10049},
year = {2022}
}
备注
8 pages, 3 figures, LREC2020 conference