词嵌入的旋转与可解释性:以俄语为例
计算与语言
2019-05-28 v1
摘要
考虑连续词嵌入模型。通常,词向量间的余弦被用作词相似度的度量。这些余弦在嵌入空间的正交变换下不变。我们证明,使用来自 SVD 的某些规范正交变换,既可能增加某些分量的意义,又可使分量在重新训练下更稳定。我们研究了公开可用的俄语模型(RusVectores、fastText、RDT)的分量可解释性。
引用
@article{arxiv.1707.04662,
title = {Rotations and Interpretability of Word Embeddings: the Case of the Russian Language},
author = {Alexey Zobnin},
journal= {arXiv preprint arXiv:1707.04662},
year = {2019}
}