BanglaBook:用于书籍评论情感分析的大规模孟加拉语数据集
计算与语言
2023-06-09 v3
摘要
通过评论表达的消费者情感分析,能够提供关于产品质量的丰富洞察。尽管情感分析在许多流行语言中已经得到广泛研究,但由于缺乏相关数据和跨领域适应性,孟加拉语所受关注相对较少。为弥补这一不足,我们提出 BanglaBook,一个由 158,065 条样本组成的大规模孟加拉语书籍评论数据集,分为积极、消极和中性三大类。我们提供了该数据集的详细统计分析,并采用一系列机器学习模型(包括 SVM、LSTM 和 Bangla-BERT)建立基线。我们的结果表明,预训练模型相比依赖人工设计特征的模型具有显著的性能优势,凸显了该领域对额外训练资源的迫切需求。此外,我们通过考察情感 unigram 进行深入的误差分析,这或许能为孟加拉语等低资源语言中的常见分类错误提供见解。我们的代码和数据公开于 https://github.com/mohsinulkabir14/BanglaBook。
引用
@article{arxiv.2305.06595,
title = {BanglaBook: A Large-scale Bangla Dataset for Sentiment Analysis from Book Reviews},
author = {Mohsinul Kabir and Obayed Bin Mahfuz and Syed Rifat Raiyan and Hasan Mahmud and Md Kamrul Hasan},
journal= {arXiv preprint arXiv:2305.06595},
year = {2023}
}
备注
Accepted in Findings of the Association for Computational Linguistics: ACL 2023