GCC-Spam:基于GAN、对比学习和字符相似性网络的垃圾邮件检测
机器学习
2025-07-25 v2 人工智能
计算与语言
摘要
垃圾文本在互联网上的指数级增长 necessitates robust detection mechanisms 以缓解信息泄露和社会不稳定等风险。本文针对两个主要挑战:垃圾发件者采用的对抗策略以及标签数据稀缺问题,提出了 novel 垃圾文本检测框架 GCC-Spam,该框架集成三个核心创新点。首先,字符相似性网络捕获正字形和音素特征,以抵御字符混淆攻击,并进而产生句子嵌入用于下游分类。其次,对比学习通过优化垃圾文本与正常文本在潜在空间中的距离来增强判别性。最后,生成对抗网络(GAN)生成逼真的伪垃圾样本,以缓解数据稀缺问题,同时提高模型鲁棒性和分类准确率。广泛的实验表明,我们的模型在真实数据集上优于基线方法,在显著减少标注样本数量的同时实现更高的检测率。
引用
@article{arxiv.2507.14679,
title = {GCC-Spam: Spam Detection via GAN, Contrastive Learning, and Character Similarity Networks},
author = {Zhijie Wang and Zixin Xu and Zhiyuan Pan},
journal= {arXiv preprint arXiv:2507.14679},
year = {2025}
}