中文

多语言词性标注:两种无监督方法

计算与语言 2014-01-23 v1

摘要

我们展示了多语言学习在无监督词性标注中的有效性。本研究的核心假设是,通过结合多种语言的线索,每种语言的结构会变得更加清晰。我们考虑了两种将这一直觉应用于无监督词性标注问题的方法:一种模型直接将一对语言的标注结构合并为单一序列,另一种模型则利用潜变量引入多语言上下文。两种方法均被构建为层次贝叶斯模型,并使用马尔可夫链蒙特卡洛采样技术进行推断。结果表明,通过融入多语言证据,我们能够在多种场景下取得显著的性能提升。我们还发现,随着可用语言数量的增加,性能会稳步提高。

关键词

引用

@article{arxiv.1401.5695,
  title  = {Multilingual Part-of-Speech Tagging: Two Unsupervised Approaches},
  author = {Tahira Naseem and Benjamin Snyder and Jacob Eisenstein and Regina Barzilay},
  journal= {arXiv preprint arXiv:1401.5695},
  year   = {2014}
}