拼接幂均值词嵌入作为通用跨语言句子表示
计算与语言
2018-09-13 v2
摘要
平均词嵌入是比更复杂的句子嵌入技术更常用的基线。然而,它们的性能通常落后于诸如 InferSent 等更复杂模型。在此,我们将平均词嵌入的概念推广为幂均值词嵌入。我们表明,不同类型幂均值词嵌入的拼接在单语上大幅缩小了与最先进方法的差距,并在跨语言上显著优于这些更复杂的技术。此外,我们提出的方法以明显优势优于近期提出的诸如 SIF 和 Sent2Vec 等不同基线,从而构成了一个更难被击败的单语基线。我们的数据和代码已公开可用。
引用
@article{arxiv.1803.01400,
title = {Concatenated Power Mean Word Embeddings as Universal Cross-Lingual Sentence Representations},
author = {Andreas Rücklé and Steffen Eger and Maxime Peyrard and Iryna Gurevych},
journal= {arXiv preprint arXiv:1803.01400},
year = {2018}
}
备注
Experiments/plots added: Normalization + Figure 1 (dimensionality vs. performance)