基于个人电子邮件的朴素贝叶斯与关键词反垃圾过滤的实验比较
计算与语言
2007-05-23 v1 信息检索
机器学习
摘要
非法商业电子邮件(亦称“垃圾邮件”)的问题日益严重,催生了可靠反垃圾邮件过滤器的需求。目前此类过滤器大多基于手动构建的关键词模式。一种替代方法近期被提出,即使用朴素贝叶斯分类器自动训练以检测垃圾邮件。我们在大型个人电子邮件集合上测试了这一方法,该集合以“加密”形式公开提供,为标准基准贡献了数据。我们引入适当的成本敏感措施,同时探讨了属性集大小、训练语料库大小、词形还原以及停用词表等问题,这些议题在以前的实验中尚未被探索。最后,比较了朴素贝叶斯过滤器与使用关键词模式的过滤器的性能,后者是广受欢迎的电子邮件阅读器中内置的过滤器。
引用
@article{arxiv.cs/0008019,
title = {An Experimental Comparison of Naive Bayesian and Keyword-Based Anti-Spam Filtering with Personal E-mail Messages},
author = {Ion Androutsopoulos and John Koutsias and Konstantinos V. Chandrinos and Constantine D. Spyropoulos},
journal= {arXiv preprint arXiv:cs/0008019},
year = {2007}
}