Word2Vec 是核对应分析的一个特例及用于自然语言处理的核方法
机器学习
2018-11-27 v3 计算与语言
摘要
我们证明对应分析(CA)等价于用适当缩放的独热编码定义基尼指数。利用该关系,我们引入 CA 的非线性核扩展。该扩展的 CA 通过利用合适列联表的专用核为自然语言提供了已知的分析。我们提出一种半监督 CA,它是 CA 核扩展的一个特例。由于 CA 若应用于众多类别需要过量内存,CA 一直未用于自然语言处理。我们通过将延迟求值引入随机奇异值分解来解决此问题。此后,内存高效的 CA 被应用于词向量表示任务。我们提出一种尾部截断核(tail-cut kernel),它是核扩展 CA 中 skip-gram 的扩展。我们的尾部截断核优于现有的词向量表示方法。
引用
@article{arxiv.1605.05087,
title = {Word2Vec is a special case of Kernel Correspondence Analysis and Kernels for Natural Language Processing},
author = {Hirotaka Niitsuma and Minho Lee},
journal= {arXiv preprint arXiv:1605.05087},
year = {2018}
}
备注
add expeiments and code