面向印地语-英语代码混合数据的情感分析集成模型
计算与语言
2018-06-13 v1
摘要
在像印度这样的多语言社会中,代码混合的社交媒体文本构成了互联网的大部分。检测代码混合用户观点的情感在理解社会、经济和政治趋势中起着关键作用。在本文中,我们提出了一种基于字符三元组的 LSTM 模型与基于词 n 元语法的多项朴素贝叶斯(MNB)模型的集成,以识别印地语-英语(Hi-En)代码混合数据的情感。该集成模型结合了来自 LSTM 模型的丰富序列模式优势与来自概率 n 元语法模型的关键词极性,以识别稀疏且不一致的代码混合数据中的情感。在真实用户代码混合数据上的实验表明,与多个基线和其他基于深度学习的已有方法相比,我们的方法取得了最先进的结果。
引用
@article{arxiv.1806.04450,
title = {An Ensemble Model for Sentiment Analysis of Hindi-English Code-Mixed Data},
author = {Madan Gopal Jhanwar and Arpita Das},
journal= {arXiv preprint arXiv:1806.04450},
year = {2018}
}