刻画词嵌入几何属性对任务性能的影响
计算与语言
2019-04-11 v1 机器学习
摘要
分析词嵌入属性以指导其在下游 NLP 任务中的使用,很大程度上是通过评估最近邻来研究的。然而,连续特征空间的几何属性直接贡献于嵌入特征在下游模型中的使用,且基本未被探索。我们考虑词嵌入几何的四种属性,即:相对于原点的位置、向量空间中特征的分布、全局两两距离以及局部两两距离。我们定义了一系列变换以生成新嵌入,将其中部分属性暴露给下游模型,并评估任务性能的变化,从而理解各属性对 NLP 模型的贡献。我们转换了来自三个流行工具包(word2vec、GloVe 和 FastText)的公开可用预训练嵌入,并在多种内在任务(对向量空间中的语言信息建模)和外在任务(将向量用作机器学习模型输入)上进行评估。我们发现内在评估对绝对位置高度敏感,而外在任务主要依赖局部相似性。我们的发现表明,未来的嵌入模型和后期处理技术应主要关注向量空间中邻近点的相似性。
引用
@article{arxiv.1904.04866,
title = {Characterizing the impact of geometric properties of word embeddings on task performance},
author = {Brendan Whitaker and Denis Newman-Griffis and Aparajita Haldar and Hakan Ferhatosmanoglu and Eric Fosler-Lussier},
journal= {arXiv preprint arXiv:1904.04866},
year = {2019}
}
备注
Appearing in the Third Workshop on Evaluating Vector Space Representations for NLP (RepEval 2019). 7 pages + references