稀缺数据下历时词嵌入的实证研究
计算与语言
2019-09-05 v1
摘要
词义变化可从随时间变化的词嵌入的漂移中推断。然而,时序数据可能过于稀疏,无法构建鲁棒的词嵌入,也难以将显著漂移与噪声区分开来。本文比较了三种在稀缺数据上学习历时词嵌入的模型:Kim 等人(2014)的 Skip-Gram 增量更新、Bamler 和 Mandt(2017)的动态滤波,以及 Rudolph 和 Blei(2018)的动态伯努利嵌入。我们特别研究了不同初始化方案的性能,并依据检测到的漂移分布,强调每种模型更适用于数据稀缺的哪些特性。最后,我们对这些模型的损失进行正则化,以更好地适应稀缺数据。
引用
@article{arxiv.1909.01863,
title = {Empirical Study of Diachronic Word Embeddings for Scarce Data},
author = {Syrielle Montariol and Alexandre Allauzen},
journal= {arXiv preprint arXiv:1909.01863},
year = {2019}
}
备注
7 pages