中文

多大才算足够大?使用超大规模语料库的无监督词义消歧

计算与语言 2017-10-24 v1

摘要

本文通过搜索具有已知含义的相关词来解决波兰语目标词的消歧问题。这些相关词被用来从未标注文本中构建训练语料库。通过提出新的丰富的替换源,用基于词网关系的启发式方法替代了传统的单义性要求,从而改进了这一技术。朴素贝叶斯分类器已被修改,以考虑未知的词义分布。由 NEKST 搜索引擎收集的包含 6 亿个网络文档(5940 亿个词例)的语料库,使我们能够评估训练集大小与消歧准确率之间的关系。该分类器使用词网基线和包含 54 个歧义词的 17,314 个人工标注出现次数的语料库进行评估。

关键词

引用

@article{arxiv.1710.07960,
  title  = {How big is big enough? Unsupervised word sense disambiguation using a very large corpus},
  author = {Piotr Przybyła},
  journal= {arXiv preprint arXiv:1710.07960},
  year   = {2017}
}