利用段落向量提升 Bi-LSTM 在印尼语情感分析中的性能
计算与语言
2020-09-15 v1 人工智能
摘要
双向长短期记忆网络(Bi-LSTM)在情感分类任务中展现出良好的性能。它将输入作为信息序列进行处理。由于这一特性,Bi-LSTM 的情感预测受词序影响,且文本的首句或尾句往往比其他短语具有更强的特征。而在印尼语情感分析的问题范围内,表达文档情感的短语可能并不出现在文档的首部或尾部,从而导致情感分类错误。为此,我们提出使用一种已有的文档表示方法——段落向量(paragraph vector)——作为 Bi-LSTM 的附加输入特征。该向量为每一次序列处理提供文档的信息上下文。段落向量被简单地拼接至文档的每个词向量上。这种表示也有助于区分有歧义的印尼语词。Bi-LSTM 与段落向量此前是作为独立方法使用的。将两种方法结合显著提升了印尼语情感分析模型的性能。在测试数据上的若干案例研究表明,所提方法能够处理 Bi-LSTM 遇到的情感短语位置问题。
引用
@article{arxiv.2009.05720,
title = {Improving Bi-LSTM Performance for Indonesian Sentiment Analysis Using Paragraph Vector},
author = {Ayu Purwarianti and Ida Ayu Putu Ari Crisdayanti},
journal= {arXiv preprint arXiv:2009.05720},
year = {2020}
}