基于GAN半监督学习的不平衡数据集虚假账号检测
机器学习
2025-02-11 v6 人工智能
密码学与安全
摘要
随着社交媒体的持续快速增长,这些平台上的骚扰行为也日益普遍。这引起了虚假检测领域研究人员的兴趣。社交媒体数据通常形成具有众多节点的复杂图,带来了若干挑战。这些挑战和局限包括处理矩阵中大量不相关特征,以及解决数据高度分散和数据集内类别分布不平衡等问题。为克服这些挑战和局限,研究人员采用了自动编码器以及半监督学习与GAN算法(称为SGAN)的结合。我们提出的方法利用自动编码器进行特征提取并引入SGAN。通过利用无标签数据集,SGAN的无监督层弥补了有标签数据有限的不足,高效利用了数量有限的有标签样本。我们采用了多种评估指标,包括混淆矩阵和ROC曲线。数据集被划分为训练集和测试集,其中100个有标签样本用于训练,1000个样本用于测试。我们研究的新颖之处在于应用SGAN解决虚假账号检测中的不平衡数据集问题。通过优化少量有标签样本的使用并降低对大量计算能力的需求,我们的方法提供了一种更高效的解决方案。此外,我们的研究仅使用100个有标签样本即在虚假账号检测中达到81%的准确率,为该领域作出了贡献。这展示了SGAN作为处理少数类及应对虚假账号检测中大数据挑战的有力工具的潜力。
引用
@article{arxiv.2212.01071,
title = {Fake detection in imbalance dataset by Semi-supervised learning with GAN},
author = {Jinus Bordbar and Saman Ardalan and Mohammadreza Mohammadrezaie and Zahra Ghasemi},
journal= {arXiv preprint arXiv:2212.01071},
year = {2025}
}
备注
Results need more investigations