使用半监督生成对抗网络的孟加拉语虚假评论检测
计算与语言
2023-09-11 v1 人工智能
机器学习
摘要
本文研究了半监督生成对抗网络(GANs)微调预训练语言模型的潜力,以利用少量标注数据将孟加拉语虚假评论从真实评论中分类出来。随着社交媒体与电子商务的兴起,检测虚假或欺骗性评论的能力对于保护消费者免受虚假信息误导变得愈发重要。任何机器学习模型都难以识别虚假评论,尤其是对于孟加拉语这类低资源语言。我们已证明所提出的半监督 GAN-LM 架构(在预训练语言模型之上的生成对抗网络)是分类孟加拉语虚假评论的可行方案,因为实验结果表明,即便仅使用 1024 个标注样本,带有半监督 GAN(SSGAN)的 BanglaBERT 也达到了 83.59% 的准确率与 84.89% 的 f1 分数,在准确率上分别优于其他预训练语言模型——BanglaBERT generator、Bangla BERT Base 与 Bangla-Electra 约 3%、4% 与 10%。实验在一个手动标注的食物评论数据集上进行,该数据集包含从各类社交媒体群组收集的共计 6014 条真实与虚假评论。因标注数据匮乏而在识别虚假评论及其他分类问题上遇到困难的研究者,可从我们提出的方法中找到一种解决方案。
引用
@article{arxiv.2304.02739,
title = {Bengali Fake Review Detection using Semi-supervised Generative Adversarial Networks},
author = {Md. Tanvir Rouf Shawon and G. M. Shahariar and Faisal Muhammad Shah and Mohammad Shafiul Alam and Md. Shahriar Mahbub},
journal= {arXiv preprint arXiv:2304.02739},
year = {2023}
}