中文

稀缺数据下历时词嵌入的实证研究

计算与语言 2019-09-05 v1

摘要

词义变化可从随时间变化的词嵌入的漂移中推断。然而,时序数据可能过于稀疏,无法构建鲁棒的词嵌入,也难以将显著漂移与噪声区分开来。本文比较了三种在稀缺数据上学习历时词嵌入的模型:Kim 等人(2014)的 Skip-Gram 增量更新、Bamler 和 Mandt(2017)的动态滤波,以及 Rudolph 和 Blei(2018)的动态伯努利嵌入。我们特别研究了不同初始化方案的性能,并依据检测到的漂移分布,强调每种模型更适用于数据稀缺的哪些特性。最后,我们对这些模型的损失进行正则化,以更好地适应稀缺数据。

关键词

引用

@article{arxiv.1909.01863,
  title  = {Empirical Study of Diachronic Word Embeddings for Scarce Data},
  author = {Syrielle Montariol and Alexandre Allauzen},
  journal= {arXiv preprint arXiv:1909.01863},
  year   = {2019}
}

备注

7 pages