中文

屈折词典中同形异义的无监督消歧

计算与语言 2020-02-26 v2

摘要

词汇歧义使得计算语料库的各种有用统计量变得困难。一个给定的词形可能代表若干形态学特征束中的任一个。然而,可使用无监督学习(如 EM)来拟合一个对词形进行概率消歧的模型。我们提出这样一种方法,其采用神经网络平滑地建模特征束上的先验分布(包括罕见者)。尽管该基础模型不考虑词的上下文,但正是此性质使其能作用于简单的 unigram 类型计数列表,将该计数在该 unigram 的不同分析中分配。我们讨论这一新任务的评测指标,并报告在 5 种语言上的结果。

关键词

引用

@article{arxiv.1806.03740,
  title  = {Unsupervised Disambiguation of Syncretism in Inflected Lexicons},
  author = {Ryan Cotterell and Christo Kirov and Sabrina J. Mielke and Jason Eisner},
  journal= {arXiv preprint arXiv:1806.03740},
  year   = {2020}
}

备注

Published at NAACL 2018