通过聚类平均词嵌入的俄语词义归纳
计算与语言
2018-05-08 v1
摘要
本文报告了我们参与俄语词义归纳与消歧共享任务(RUSSE-2018)的情况。在所有 19 个参与者中,我们的团队在 wiki-wiki 数据集(主要包含同形异义词)上排名第 2,在 bts-rnc 和 active-dict 数据集(主要包含多义词)上排名第 5。我们所采用的方法极为简单。它意味着将歧义词的上下文表示为平均词嵌入向量,使用现成的预训练分布模型。然后,这些向量表示用主流聚类技术进行聚类,从而产生对应于歧义词义的分组。作为一个附带结果,我们表明在小型但均衡的语料库上训练的词嵌入模型可以优于在大型但有噪声的数据上训练的模型——不仅在内在评价中,而且在与词义归纳这样的下游任务中。
引用
@article{arxiv.1805.02258,
title = {Russian word sense induction by clustering averaged word embeddings},
author = {Andrey Kutuzov},
journal= {arXiv preprint arXiv:1805.02258},
year = {2018}
}
备注
Proceedings of the 24rd International Conference on Computational Linguistics and Intellectual Technologies (Dialogue-2018)