基于提取特征的假评论检测优化机器学习分类器
计算与语言
2025-12-01 v1
摘要
假评论广为人知,会动摇在线购买的合法性和可靠性。最新导致客户陷入误区的发展是人工评论与计算机生成(CG)评论的出现。本文提出了一种先进的机器学习系统,用于对这些由 AI 产生的评论进行高度精确的分析。我们的方法集成了高级文本预处理、多模态特征提取、哈里斯猎鹰优化(HHO)进行特征选择,以及堆叠集成分类器。我们在 40,432 条原始(OR)和计算机生成(CG)评论的数据集上实现了该方法。从初始的 13,539 个特征中,HHO 选择了最适用的 1,368 个特征,实现了 89.9% 的降维。我们的最终堆叠模型实现了 95.40% 的准确率、92.81% 的精确率、95.01% 的召回率和 93.90% 的 F1 分数,这表明集成学习和仿生优化的组合是一种有效的方法,用于机器生成文本识别。由于大规模评论分析通常在云平台上运行,诸如差分隐私和安全外包等隐私保护技术对于保护用户数据至关重要。
引用
@article{arxiv.2511.21716,
title = {An Optimized Machine Learning Classifier for Detecting Fake Reviews Using Extracted Features},
author = {Shabbir Anees and Anshuman and Ayush Chaurasia and Prathmesh Bogar},
journal= {arXiv preprint arXiv:2511.21716},
year = {2025}
}