中文

DeepCapture:基于深度学习与数据增强的图像垃圾邮件检测

机器学习 2020-06-17 v1 计算机视觉与模式识别 机器学习

摘要

图像垃圾邮件常被用来规避基于文本的垃圾邮件过滤器,后者通过频繁使用的关键词检测垃圾邮件。在本文中,我们提出了一种称为 DeepCapture 的新的图像垃圾邮件检测工具,使用卷积神经网络 (CNN) 模型。已有许多检测图像垃圾邮件的努力,但由于训练阶段过拟合,面对全新且未见过的图像垃圾邮件时性能显著下降。为解决这一挑战性问题,我们主要专注于开发更鲁棒的模型以应对过拟合问题。我们的核心思想是构建一个仅由八层组成的 CNN-XGBoost 框架,并利用针对图像垃圾邮件检测任务定制的数据增强技术获得大量训练样本。为展示 DeepCapture 的可行性,我们使用由 6,000 个垃圾和 2,313 个非垃圾图像样本组成的公开数据集评估其性能。实验结果表明,DeepCapture 能够达到 88% 的 F1-score,比现有最佳垃圾邮件检测模型 CNN-SVM 的 82% F1-score 提高了 6%。此外,面对新的和未见的图像数据集,DeepCapture 优于现有的图像垃圾邮件检测方案。

关键词

引用

@article{arxiv.2006.08885,
  title  = {DeepCapture: Image Spam Detection Using Deep Learning and Data Augmentation},
  author = {Bedeuro Kim and Sharif Abuadbba and Hyoungshick Kim},
  journal= {arXiv preprint arXiv:2006.08885},
  year   = {2020}
}

备注

15 pages, single column. ACISP 2020: Australasian Conference on Information Security and Privacy