中文

基于循环神经网络语言模型适应的文档向量

计算与语言 2016-12-15 v1

摘要

在许多自然语言处理(NLP)任务中,文档通常使用词频-逆文档频率(TF-IDF)向量以词袋模型建模。基于频率的 TF-IDF 特征向量的一个主要缺点是它忽略了携带文档中词语之间句法和语义关系的词序,而词序在某些 NLP 任务(如体裁分类)中可能很重要。本文提出了一种新的文档分布式向量表示:首先从任务中的所有文档构建一个简单的循环神经网络语言模型(RNN-LM)或长短期记忆 RNN 语言模型(LSTM-LM),然后每个文档对其部分语言模型参数进行适应,并将适应后的参数向量化以表示该文档。新的文档向量分别标记为 DV-RNN 和 DV-LSTM。我们认为新的文档向量能够捕捉文档中的一些高层序列信息,这是其他当前文档表示所无法捕捉的。新的文档向量在三个语料库的文档体裁分类任务中进行了评估:Brown 语料库、BNC Baby 语料库和一个人工创建的 Penn Treebank 数据集。其分类性能与 TF-IDF 向量和最先进的段落分布式记忆模型(PV-DM)进行了比较。结果表明,DV-LSTM 在大多数情况下显著优于 TF-IDF 和 PV-DM,而将所提出的文档向量与 TF-IDF 或 PV-DM 组合可能进一步提高性能。

关键词

引用

@article{arxiv.1611.00196,
  title  = {Recurrent Neural Network Language Model Adaptation Derived Document Vector},
  author = {Wei Li and Brian Kan Wing Mak},
  journal= {arXiv preprint arXiv:1611.00196},
  year   = {2016}
}