中文

通过预测 N-gram 学习文档嵌入以用于长电影评论的情感分类

计算与语言 2016-04-26 v5

摘要

尽管会丢失语义信息,基于 bag-of-ngram 的方法在诸如长电影评论的情感分类等任务上仍然取得了 state-of-the-art 的结果。已经提出了许多文档嵌入方法来捕获语义,但它们在此任务上仍然无法超越基于 bag-of-ngram 的方法。在本文中,我们修改了最近提出的 Paragraph Vector 的架构,使其能够通过不仅预测单词,还预测 n-gram 特征来学习文档向量。我们的模型能够捕获文档中的语义和词序,同时保持所学向量的表达能力。在 IMDB 电影评论数据集上的实验结果表明,由于上述优势,我们的模型超越了以前的深度学习模型和基于 bag-of-ngram 的模型。当我们的模型与其他模型结合时,也获得了更稳健的结果。我们模型的源代码也将随本文一同发布。

关键词

引用

@article{arxiv.1512.08183,
  title  = {Learning Document Embeddings by Predicting N-grams for Sentiment Classification of Long Movie Reviews},
  author = {Bofang Li and Tao Liu and Xiaoyong Du and Deyuan Zhang and Zhe Zhao},
  journal= {arXiv preprint arXiv:1512.08183},
  year   = {2016}
}