中文

多义词的分布表示:一种损失驱动方法

计算与语言 2019-04-16 v1 人工智能

摘要

Word2Vec 的 Skip Gram 模型是当前估计词分布表示的最优方法。然而,它假设每个词对应单一向量,这并不适合表示具有多个义项的词。本工作提出 LDMI,一种估计词分布表示的新模型。LDMI 基于如下思想:若一个词承载多个义项,则为其每个义项赋予不同表示,相比于对所有义项使用单一向量表示,应能在预测其共现词时获得更低的损失。在识别多义词后,LDMI 对这些词的出现实例进行聚类,以为每个实例分配一个义项。在上下文词相似度任务上的实验表明,LDMI 优于竞争方法。

关键词

引用

@article{arxiv.1904.06725,
  title  = {Distributed representation of multi-sense words: A loss-driven approach},
  author = {Saurav Manchanda and George Karypis},
  journal= {arXiv preprint arXiv:1904.06725},
  year   = {2019}
}

备注

PAKDD 2018 Best paper award runner-up