BAN-ABSA:一个孟加拉语基于方面的情感分析数据集及其基线评估
计算与语言
2020-12-02 v1
摘要
由于社交媒体或报纸用户评论、在线产品评论评论的惊人增长,情感分析(SA)已引起研究人员的极大兴趣。随着领域的快速扩展,SA 工作不仅旨在预测句子或文档的情感,还旨在给出句子或文档不同方面的必要细节(即基于方面的情感分析)。已有大量用于 SA 和基于方面的情感分析(ABSA)的英语及其他知名欧洲语言数据集可用。在本文中,我们提出一个人工标注的高质量孟加拉语数据集 BAN-ABSA,由 3 名母语为孟加拉语者标注方面及其关联情感。该数据集包含从一些著名孟加拉语新闻门户收集的 9,009 条独特评论中的 2,619 条正面、4,721 条负面和 1,669 条中性数据样本。此外,我们进行了以深度学习模型为重点的基线评估,在方面词提取上达到 78.75% 的准确率,在情感分类上达到 71.08% 的准确率。在 BAN-ABSA 数据集上的实验表明,CNN 模型在准确率方面更优,尽管 Bi-LSTM 在平均 F1 分数上显著优于 CNN 模型。
引用
@article{arxiv.2012.00288,
title = {BAN-ABSA: An Aspect-Based Sentiment Analysis dataset for Bengali and it's baseline evaluation},
author = {Mahfuz Ahmed Masum and Sheikh Junayed Ahmed and Ayesha Tasnim and Md Saiful Islam},
journal= {arXiv preprint arXiv:2012.00288},
year = {2020}
}
备注
11 pages,2 figures, 8 tables Included in proceedings of International Joint Conference on Advances in Computational Intelligence (IJCACI) 2020