中文

语料库比较:以瑞典语 Gigaword 与 Wikipedia 语料库为例

计算与语言 2020-11-09 v1 机器学习

摘要

在这项工作中,我们表明对于给定的语言,来自不同来源数据的词嵌入性能差异可能由数据规模以外的其他因素造成。自然语言处理(NLP)任务通常在使用较大语料库的词嵌入时表现更好。然而,所覆盖领域的广度与噪声可能起到重要作用。我们基于两个瑞典语料库——Gigaword 与 Wikipedia,在类比(内在)测试中评估词嵌入,发现来自 Wikipedia 语料库的嵌入总体上优于来自规模更大的 Gigaword 语料库的嵌入。要确定性的评估还需进行下游测试。

关键词

引用

@article{arxiv.2011.03281,
  title  = {Corpora Compared: The Case of the Swedish Gigaword & Wikipedia Corpora},
  author = {Tosin P. Adewumi and Foteini Liwicki and Marcus Liwicki},
  journal= {arXiv preprint arXiv:2011.03281},
  year   = {2020}
}

备注

Presented at the Eighth Swedish Language Technology Conference (SLTC)