中文

不满足于平均,追求最大:模糊集合与最大池化词向量

计算与语言 2019-05-01 v1 机器学习

摘要

近期文献表明,平均词向量辅以简单后处理在语义文本相似度任务上优于许多深度学习方法。此外,当平均词向量在大型释义语料库上受监督训练时,它们在标准 STS 基准上取得了最先进的结果。受这些发现的启发,我们进一步推进词嵌入的极限。我们提出了一种新颖的文本模糊词袋(FBoW)表示,它同时包含词汇表中的所有词,但具有不同程度的隶属度,这些隶属度由词向量之间的相似性导出。我们表明,最大池化词向量仅是模糊词袋的一个特例,并且应通过模糊 Jaccard 指数而非余弦相似度进行比较。最后,我们提出 DynaMax,一种完全无监督且非参数的相似度度量,它根据句子对动态提取并最大池化优良特征。该方法高效且易于实现,却在 STS 任务上大幅优于当前基线,甚至可与直接优化余弦相似度而训练的有监督词向量相竞争。

关键词

引用

@article{arxiv.1904.13264,
  title  = {Don't Settle for Average, Go for the Max: Fuzzy Sets and Max-Pooled Word Vectors},
  author = {Vitalii Zhelezniak and Aleksandar Savkov and April Shen and Francesco Moramarco and Jack Flann and Nils Y. Hammerla},
  journal= {arXiv preprint arXiv:1904.13264},
  year   = {2019}
}

备注

Published as a conference paper at ICLR 2019