句子和文档的分布式表示
计算与语言
2014-05-26 v2 人工智能
机器学习
摘要
许多机器学习算法要求输入表示为固定长度的特征向量。对于文本而言,最常见的固定长度特征之一是词袋模型。尽管词袋模型很流行,但它有两个主要缺点:丢失了词的顺序,并且忽略了词的语义。例如,“powerful”、“strong”和“Paris”之间的距离是相等的。本文提出段落向量(Paragraph Vector),一种无监督算法,可以从可变长度的文本片段(如句子、段落和文档)中学习固定长度的特征表示。我们的算法将每个文档表示为一个稠密向量,该向量经过训练以预测文档中的词。其构造使我们的算法有潜力克服词袋模型的弱点。实验结果表明,段落向量在文本表示方面优于词袋模型以及其他技术。最后,我们在几个文本分类和情感分析任务上取得了新的最优结果。
引用
@article{arxiv.1405.4053,
title = {Distributed Representations of Sentences and Documents},
author = {Quoc V. Le and Tomas Mikolov},
journal= {arXiv preprint arXiv:1405.4053},
year = {2014}
}