中文

CEAI:基于 CCM 的电子邮件作者身份识别模型

机器学习 2013-12-10 v1

摘要

本文提出了一种利用基于聚类的分类(CCM)技术的电子邮件作者身份识别(EAI)模型。传统上,文体特征已成功应用于各种作者身份分析任务;我们将传统特征集扩展为包含一些更有趣且有效的电子邮件作者身份识别特征(例如电子邮件中使用的最后一个标点符号、作者在电子邮件开头使用大写字母的倾向、或问候语/告别语后的标点符号)。我们还包含了基于信息增益特征选择的内容特征。观察到在作者身份识别过程中使用此类特征对该任务的准确性有积极影响。我们进行了实验以证明我们的论点,并将结果与其他基线模型进行了比较。实验结果表明,所提出的基于 CCM 的电子邮件作者身份识别模型连同所提出的特征集,优于最先进的基于支持向量机(SVM)的模型,以及 Iqbal 等人 [1, 2] 提出的模型。所提出的模型在 Enron 数据集上针对 10 位作者、25 位作者和 50 位作者的准确率分别达到 94%、89% 和 81%,而在作者构建的真实电子邮件数据集上达到了 89.5% 的准确率。与 Iqbal 等人 [1, 2] 提出的模型相比,Enron 数据集上的结果是在相当多的作者数量上取得的。

关键词

引用

@article{arxiv.1312.2451,
  title  = {CEAI: CCM based Email Authorship Identification Model},
  author = {Sarwat Nizamani and Nasrullah Memon},
  journal= {arXiv preprint arXiv:1312.2451},
  year   = {2013}
}