混合改进文档级嵌入 (HIDE)
计算与语言
2020-06-03 v1 机器学习
摘要
近年来,词嵌入在情感分析中发挥着重要作用。由于词嵌入的生成需要大规模语料,许多应用使用预训练嵌入。尽管取得了成功,词嵌入仍存在某些缺陷,例如无法捕捉词的情感信息、词性标注层面的上下文信息以及领域特定信息。本文提出 HIDE,一种混合改进文档级嵌入(Hybrid Improved Document level Embedding),它将领域信息、词性信息与情感信息融入现有的词嵌入(如 GloVe 和 Word2Vec)中。该方法将改进后的词嵌入组合为文档级嵌入。此外,使用潜在语义分析(LSA)将文档表示为向量。HIDE 由 LSA 与基于改进词嵌入计算得到的文档级嵌入组合生成。我们在六个不同数据集上测试了 HIDE,并显示出相对于现有预训练词向量(如 GloVe 和 Word2Vec)准确率的显著提升。我们进一步将本工作与两种现有文档级情感分析方法进行比较,HIDE 表现优于现有系统。
引用
@article{arxiv.2006.01203,
title = {Hybrid Improved Document-level Embedding (HIDE)},
author = {Satanik Mitra and Mamata Jenamani},
journal= {arXiv preprint arXiv:2006.01203},
year = {2020}
}