屈折词典中同形异义的无监督消歧
计算与语言
2020-02-26 v2
摘要
词汇歧义使得计算语料库的各种有用统计量变得困难。一个给定的词形可能代表若干形态学特征束中的任一个。然而,可使用无监督学习(如 EM)来拟合一个对词形进行概率消歧的模型。我们提出这样一种方法,其采用神经网络平滑地建模特征束上的先验分布(包括罕见者)。尽管该基础模型不考虑词的上下文,但正是此性质使其能作用于简单的 unigram 类型计数列表,将该计数在该 unigram 的不同分析中分配。我们讨论这一新任务的评测指标,并报告在 5 种语言上的结果。
引用
@article{arxiv.1806.03740,
title = {Unsupervised Disambiguation of Syncretism in Inflected Lexicons},
author = {Ryan Cotterell and Christo Kirov and Sabrina J. Mielke and Jason Eisner},
journal= {arXiv preprint arXiv:1806.03740},
year = {2020}
}
备注
Published at NAACL 2018