中文

词嵌入的有监督理解

计算与语言 2020-06-25 v1 机器学习

摘要

预训练词嵌入被广泛用于自然语言处理中的迁移学习。这些嵌入是词的连续分布式表示,可在紧凑的欧氏空间中保持词的相似性。然而,这些空间的维度不提供任何清晰的解释。在本研究中,我们以获得词嵌入上线性关键词级分类器的形式得到了有监督投影。我们展示了该方法创建了原始嵌入维度的可解释投影。训练好的分类器节点的激活对应于词汇表中的词的一个子集。因此,它们的行为类似于词典特征,同时具有连续值输出的优点。此外,此类词典可通过多轮迭代增长,方法是将专家标签添加到得分最高的词上,以扩充初始关键词集合。同样,相同的分类器可应用于其他语言中对齐的词嵌入,以获得相应的词典。在我们的实验中,我们展示了用这些分类器权重初始化高阶网络可为下游NLP任务提供更准确的模型。我们进一步展示了有监督维度在揭示感兴趣关键词的多义性方面的有用性,方法是在不同子空间中使用学习到的分类器投影其嵌入。

关键词

引用

@article{arxiv.2006.13299,
  title  = {Supervised Understanding of Word Embeddings},
  author = {Halid Ziya Yerebakan and Parmeet Bhatia and Yoshihisa Shinagawa},
  journal= {arXiv preprint arXiv:2006.13299},
  year   = {2020}
}