含噪孟加拉语文本情感分析中降噪方法的比较分析
计算与语言
2024-01-31 v2
摘要
虽然孟加拉语被认为是一种资源有限的语言,但情感分析一直是文献中广泛研究的主题。然而,专门针对含噪孟加拉语文本领域的情感分析探索却很少。在本文中,我们引入了一个数据集(NC-SentNoB),该数据集是我们手动标注的,用于识别一个包含约 15K 条含噪孟加拉语文本的现有情感分析数据集中发现的十种不同类型的噪声。首先,给定一个输入的含噪文本,我们识别其噪声类型,将此任务视为一个多标签分类任务。然后,我们引入基线降噪方法,在进行情感分析之前减轻噪声。最后,我们评估了微调后的情感分析模型在含噪文本和降噪后文本上的性能,以进行比较。实验结果表明,所采用的降噪方法并不令人满意,这突显了在未来的研究工作中需要更合适的降噪方法。我们已将本文提出的实现和数据集在 https://github.com/ktoufiquee/A-Comparative-Analysis-of-Noise-Reduction-Methods-in-Sentiment-Analysis-on-Noisy-Bangla-Texts 上公开。
引用
@article{arxiv.2401.14360,
title = {A Comparative Analysis of Noise Reduction Methods in Sentiment Analysis on Noisy Bangla Texts},
author = {Kazi Toufique Elahi and Tasnuva Binte Rahman and Shakil Shahriar and Samir Sarker and Md. Tanvir Rouf Shawon and G. M. Shahariar},
journal= {arXiv preprint arXiv:2401.14360},
year = {2024}
}
备注
Accepted in The 9th Workshop on Noisy and User-generated Text (W-NUT), 18th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2024)