中文

改进基于 tf-idf 加权的文档向量嵌入

计算与语言 2019-02-27 v1

摘要

我们研究了一系列在给定一组词向量(如来自 word2vec 或 GloVe 的词向量)时,为语料库中的文档计算稠密向量嵌入的方法。我们描述了两种能够改进简单加权和的方法,它们在最大化特定加权余弦相似度度量的意义下是最优的。我们考虑了若干加权函数,包括逆文档频率(idf)、平滑逆频率(SIF)以及 word2vec 中使用的子采样函数。我们发现 idf 对我们的应用效果最好。我们还采用 Arora 等人提出的公共成分去除作为后处理,并发现其在大多数情况下是有帮助的。我们在一项使用 TripAdvisor 评论的新评估任务以及文献中的 CQADupStack 基准上,将这些嵌入变体与 doc2vec 嵌入进行了比较。

关键词

引用

@article{arxiv.1902.09875,
  title  = {Improving a tf-idf weighted document vector embedding},
  author = {Craig W. Schmidt},
  journal= {arXiv preprint arXiv:1902.09875},
  year   = {2019}
}