中文

用PCA考察词嵌入的结构

计算与语言 2019-06-04 v1

摘要

本文比较了用于英-捷神经机器翻译(NMT)、word2vec和情感分析的捷克语词嵌入的结构。我们表明,尽管可以从word2vec和各种翻译模型的词嵌入中成功预测词性(POS)标签,但并非所有嵌入空间都呈现相同的结构。关于POS的信息存在于word2vec嵌入中,但NMT解码器中按POS高度组织化的现象表明,该信息对机器翻译更为重要,因此NMT模型以更直接的方式表示它。我们的方法基于主成分分析(PCA)维度与类别语言数据的相关性。我们还表明,进一步考察沿主成分的类别直方图对于理解嵌入中信息表示的结构十分重要。

关键词

引用

@article{arxiv.1906.00114,
  title  = {Examining Structure of Word Embeddings with PCA},
  author = {Tomáš Musil},
  journal= {arXiv preprint arXiv:1906.00114},
  year   = {2019}
}

备注

12 pages, 6 figures, accepted to The 22th International Conference of Text, Speech and Dialogue (TSD2019) in Ljubljana