中文

混合改进文档级嵌入 (HIDE)

计算与语言 2020-06-03 v1 机器学习

摘要

近年来,词嵌入在情感分析中发挥着重要作用。由于词嵌入的生成需要大规模语料,许多应用使用预训练嵌入。尽管取得了成功,词嵌入仍存在某些缺陷,例如无法捕捉词的情感信息、词性标注层面的上下文信息以及领域特定信息。本文提出 HIDE,一种混合改进文档级嵌入(Hybrid Improved Document level Embedding),它将领域信息、词性信息与情感信息融入现有的词嵌入(如 GloVe 和 Word2Vec)中。该方法将改进后的词嵌入组合为文档级嵌入。此外,使用潜在语义分析(LSA)将文档表示为向量。HIDE 由 LSA 与基于改进词嵌入计算得到的文档级嵌入组合生成。我们在六个不同数据集上测试了 HIDE,并显示出相对于现有预训练词向量(如 GloVe 和 Word2Vec)准确率的显著提升。我们进一步将本工作与两种现有文档级情感分析方法进行比较,HIDE 表现优于现有系统。

关键词

引用

@article{arxiv.2006.01203,
  title  = {Hybrid Improved Document-level Embedding (HIDE)},
  author = {Satanik Mitra and Mamata Jenamani},
  journal= {arXiv preprint arXiv:2006.01203},
  year   = {2020}
}