聚类俄语与乌克兰语学术文本的可比语料库:词嵌入与语义指纹
计算与语言
2016-04-20 v1
摘要
我们介绍了将分布语义学(神经词嵌入)应用于双语可比语料库中文档表示与聚类问题的经验。我们的数据是俄语和乌克兰语学术文本的集合,其主题即所属学科领域。为了构建这些文档的语言无关语义表示,我们在单语语料库上训练神经分布模型,并学习从一种语言到另一种语言的向量的最优线性变换。所得向量随后用于生成文档的“语义指纹”,作为聚类算法的输入。所提出的方法与若干基线进行比较,包括基于Levenshtein编辑距离的“正字法翻译”,并以较大优势优于它们。我们还表明,语言无关的“语义指纹”优于先前工作中提出的多语言聚类算法,同时需要更少的语言资源。
引用
@article{arxiv.1604.05372,
title = {Clustering Comparable Corpora of Russian and Ukrainian Academic Texts: Word Embeddings and Semantic Fingerprints},
author = {Andrey Kutuzov and Mikhail Kopotev and Tatyana Sviridenko and Lyubov Ivanova},
journal= {arXiv preprint arXiv:1604.05372},
year = {2016}
}
备注
To be presented at 9th Workshop on Building and Using Comparable Corpora, co-located with LREC-2016 (https://comparable.limsi.fr/bucc2016/)