中文

分布同义词词典的网络嵌入能否与词向量结合以获得更好表示?

计算与语言 2018-02-20 v1

摘要

近年来,从文本中学习到的词分布式表示已在各种自然语言处理任务中被证明是成功的。一些方法将词表示为使用预测模型(Word2vec)或稠密基于计数的模型(GloVe)从文本计算的向量,另一些则试图将其表示为分布同义词词典网络结构,其中词的邻域是一组具有充分上下文重叠的词。受近期网络嵌入技术(DeepWalk、LINE、node2vec 等)研究热潮的启发,我们将分布同义词词典网络转换为稠密词向量,并探究分布同义词词典嵌入在改进整体词表示方面的有用性。这是首次尝试表明,将所提分布同义词词典嵌入获得的词表示与最先进的词表示相结合,能在词相似度与关联度、同义词检测、类比检测等 NLP 任务上显著提升性能。此外,我们表明即使不使用任何手工构建的词汇资源,我们也能在词相似度与关联度任务上获得与使用了词汇资源的表示相当的性能。

关键词

引用

@article{arxiv.1802.06196,
  title  = {Can Network Embedding of Distributional Thesaurus be Combined with Word Vectors for Better Representation?},
  author = {Abhik Jana and Pawan Goyal},
  journal= {arXiv preprint arXiv:1802.06196},
  year   = {2018}
}