面向低资源语言的情感分析器研究
计算与语言
2020-12-04 v1 人工智能
摘要
Twitter 是最具影响力的社交媒体之一,拥有数百万活跃用户。它通常用于微博,允许用户分享消息、想法、思绪等。因此,在 Twitter 用户之间流动着数百万次互动,如短消息或推文,讨论全球发生的各种话题。本研究旨在分析用户针对当时被积极且大量讨论的特定趋势话题的情感。我们选择了在 2019 年印度尼西亚总统选举期间成为趋势话题的标签 #kpujangancurang。我们利用该标签从 Twitter 获取一组数据,以进一步分析和调查用户从其推文中表达的正面或负面情感。本研究利用 rapid miner 工具生成 Twitter 数据,并比较 Naive Bayes、K-Nearest Neighbor、Decision Tree 和 Multi-Layer Perceptron 分类方法对 Twitter 数据进行情感分类。本实验共有 200 条标注数据。总体而言,Naive Bayes 和 Multi-Layer Perceptron 分类在 11 次不同训练-测试数据划分比例的实验中优于另外两种方法。这两种分类器有潜力用于构建具有小规模语料的低资源语言的情感分析器。
引用
@article{arxiv.2011.06382,
title = {Towards A Sentiment Analyzer for Low-Resource Languages},
author = {Dian Indriani and Arbi Haza Nasution and Winda Monika and Salhazan Nasution},
journal= {arXiv preprint arXiv:2011.06382},
year = {2020}
}
备注
Accepted to be published in Proceedings of International Conference on Smart Computing and Cyber Security (SMARTCYBER 2020)