中文

聚类俄语与乌克兰语学术文本的可比语料库:词嵌入与语义指纹

计算与语言 2016-04-20 v1

摘要

我们介绍了将分布语义学(神经词嵌入)应用于双语可比语料库中文档表示与聚类问题的经验。我们的数据是俄语和乌克兰语学术文本的集合,其主题即所属学科领域。为了构建这些文档的语言无关语义表示,我们在单语语料库上训练神经分布模型,并学习从一种语言到另一种语言的向量的最优线性变换。所得向量随后用于生成文档的“语义指纹”,作为聚类算法的输入。所提出的方法与若干基线进行比较,包括基于Levenshtein编辑距离的“正字法翻译”,并以较大优势优于它们。我们还表明,语言无关的“语义指纹”优于先前工作中提出的多语言聚类算法,同时需要更少的语言资源。

关键词

引用

@article{arxiv.1604.05372,
  title  = {Clustering Comparable Corpora of Russian and Ukrainian Academic Texts: Word Embeddings and Semantic Fingerprints},
  author = {Andrey Kutuzov and Mikhail Kopotev and Tatyana Sviridenko and Lyubov Ivanova},
  journal= {arXiv preprint arXiv:1604.05372},
  year   = {2016}
}

备注

To be presented at 9th Workshop on Building and Using Comparable Corpora, co-located with LREC-2016 (https://comparable.limsi.fr/bucc2016/)