一个词有多重?为词义归纳加权词嵌入
计算与语言
2018-10-26 v2
摘要
本文描述了我们参与首届俄语词义归纳与消歧共享任务 RUSSE'2018(Panchenko 等,2018)的情况。对于数十个多义词中的每一个,参与者被要求根据该词事先未给出的义项对包含它的文本片段进行分组,因此任务包含“归纳”部分。例如,给出一个词“bank”以及该词出现的一组文本片段(也称为“上下文”),如“bank is a financial institution that accepts deposits”和“river bank is a slope beside a body of water”。参与者被要求将这些上下文聚类为事先未知数量的簇,对应于本例中“bank”的“公司”和“区域”义项。组织者基于维基百科文本、网页和俄语词典分别提出了三个复杂度与文本体裁各异的评测数据集。我们呈现了两个实验:一个正向实验和一个负向实验,分别基于表示为词嵌入加权平均的上下文聚类和基于两个前沿生产级神经机器翻译系统的机器翻译。我们的团队在 18 支参赛队伍中于两个数据集上取得第二佳结果,在剩余一个数据集上取得第三佳结果。我们大幅超越了往年基于义项嵌入的竞争性前沿基线。
引用
@article{arxiv.1805.09209,
title = {How much does a word weigh? Weighting word embeddings for word sense induction},
author = {Nikolay Arefyev and Pavel Ermolaev and Alexander Panchenko},
journal= {arXiv preprint arXiv:1805.09209},
year = {2018}
}
备注
In the Proceedings of the 24rd International Conference on Computational Linguistics and Intellectual Technologies (Dialogue'2018), Moscow, Russia. RGGU