通过词义消歧改进基于词典的词嵌入
计算与语言
2017-07-25 v1
摘要
已有一些工作将词典与语料库共同学习以改进词嵌入。然而,这些工作要么对词典单独建模,但使用相同的似然函数来更新语料库和词典的神经网络,要么最小化词典中所有同义词对之间的距离。此类方法未考虑语料库与词典之间的相关性与差异性,可能并非最优。在本文中,我们提出了一种考虑语料库与词典相关性与差异性的新方法。该方法通过学习语料库,在给定上下文下同时预测一个词及其对应的同义词来训练词嵌入。对于多义词,我们使用词义消歧过滤器来消除在当前上下文中具有不同含义的同义词。为了评估所提出的方法,我们在词相似度任务和文本分类任务中,比较了由我们提出的模型训练的词嵌入、无过滤器或无词典的对照组以及先前工作的表现。实验结果表明,所提出的模型为多义词提供了更好的嵌入,并提升了文本分类的性能。
引用
@article{arxiv.1707.07628,
title = {Improve Lexicon-based Word Embeddings By Word Sense Disambiguation},
author = {Yuanzhi Ke and Masafumi Hagiwara},
journal= {arXiv preprint arXiv:1707.07628},
year = {2017}
}
备注
We submitted a highly overlapped one to Transactions of the Japanese Society for Artificial Intelligence