改进基于 tf-idf 加权的文档向量嵌入
计算与语言
2019-02-27 v1
摘要
我们研究了一系列在给定一组词向量(如来自 word2vec 或 GloVe 的词向量)时,为语料库中的文档计算稠密向量嵌入的方法。我们描述了两种能够改进简单加权和的方法,它们在最大化特定加权余弦相似度度量的意义下是最优的。我们考虑了若干加权函数,包括逆文档频率(idf)、平滑逆频率(SIF)以及 word2vec 中使用的子采样函数。我们发现 idf 对我们的应用效果最好。我们还采用 Arora 等人提出的公共成分去除作为后处理,并发现其在大多数情况下是有帮助的。我们在一项使用 TripAdvisor 评论的新评估任务以及文献中的 CQADupStack 基准上,将这些嵌入变体与 doc2vec 嵌入进行了比较。
引用
@article{arxiv.1902.09875,
title = {Improving a tf-idf weighted document vector embedding},
author = {Craig W. Schmidt},
journal= {arXiv preprint arXiv:1902.09875},
year = {2019}
}