Enron 语料库:邮件正文藏何处?
信息检索
2020-01-29 v1 机器学习
社会与信息网络
摘要
为探查最大的公共领域电子邮件数据库中的欺诈迹象,我们应用机器学习完成了四项调查任务。首先,利用财务记录与电子邮件识别利益相关人员(POI),报告峰值准确率达 95.7%。其次,查找任何公开暴露的个人可识别信息(PII),发现 5 万条此前未报告的实例。第三,自动标记由加州电力中断诉讼中的人类专家评分的法律响应邮件,发现峰值准确率达 99%。最后,我们追踪了企业危机前、中、后三年间超过 1 万独特人物的首要主题与情感。在可能处,我们将 51 种算法的准确率与执行时间比较,并报告可扩展到海量数据集的具人类可解释性的业务规则。
引用
@article{arxiv.2001.10374,
title = {The Enron Corpus: Where the Email Bodies are Buried?},
author = {David Noever},
journal= {arXiv preprint arXiv:2001.10374},
year = {2020}
}