使用机器学习与神经网络方法的码混合情感分析
计算与语言
2018-08-13 v1
摘要
印度语言情感分析(SAIL)-码混合工具竞赛旨在识别印度语言对(Hi-En、Ben-Hi-En)码混合数据集的句子级情感极性。Hi-En数据集此后分别称为HI-EN,Ben-Hi-En数据集称为BN-EN。为此,我们提交了四个模型用于HI-EN和BN-EN码混合数据集的情感分析。第一个模型是由三个分类器——线性SVM、逻辑回归和随机森林——组成的集成投票分类器,第二个是线性SVM。两个模型均使用字符n-gram的TF-IDF特征向量,其中n从2到6。我们使用scikit-learn(sklearn)机器学习库实现这两种方法。Run1来自投票分类器,Run2使用线性SVM模型生成结果。在四个提交的输出中,Run2在两个数据集上均优于Run1。我们以HI-EN的F值0.569和BN-EN的F值0.526在两项竞赛中均获第一。
引用
@article{arxiv.1808.03299,
title = {Code-Mixed Sentiment Analysis Using Machine Learning and Neural Network Approaches},
author = {Pruthwik Mishra and Prathyusha Danda and Pranav Dhakras},
journal= {arXiv preprint arXiv:1808.03299},
year = {2018}
}
备注
6 pages