中文

基于元数据的越南电商网站垃圾评论检测

计算与语言 2024-08-02 v2

摘要

垃圾评论(意见)检测问题近年来受到广泛关注,尤其是随着电子商务的快速发展。垃圾评论通常基于评论内容进行分类,但在某些情况下,仅凭内容特征对于模型准确判断评论标签是不够的。本文介绍了 ViSpamReviews v2 数据集,其中包括评论的元数据,以整合额外属性用于垃圾评论分类。我们提出了一种新方法,同时将文本和类别属性整合到分类模型中。在实验中,产品类别在结合深度神经网络(DNN)模型时效果显著,而文本特征在两种 DNN 模型中都表现良好,模型在越南电商网站垃圾评论检测任务中实现了最佳性能,即 PhoBERT。具体而言,当结合由 SPhoBert 模型生成的产品描述特征时,PhoBERT 模型取得最高准确率,这是 PhoBERT 与 SentenceBERT 组合的结果。使用宏平均 F1 分数,垃圾评论分类任务达到 87.22% (相较于基线提高 1.64%),而识别垃圾评论类型任务达到 73.49% (相较于基线提高 1.93%)。

关键词

引用

@article{arxiv.2405.13292,
  title  = {Metadata Integration for Spam Reviews Detection on Vietnamese E-commerce Websites},
  author = {Co Van Dinh and Son T. Luu},
  journal= {arXiv preprint arXiv:2405.13292},
  year   = {2024}
}

备注

Published in the International Journal of Asian Language Processing (IJALP)