中文

Enron 语料库:邮件正文藏何处?

信息检索 2020-01-29 v1 机器学习 社会与信息网络

摘要

为探查最大的公共领域电子邮件数据库中的欺诈迹象,我们应用机器学习完成了四项调查任务。首先,利用财务记录与电子邮件识别利益相关人员(POI),报告峰值准确率达 95.7%。其次,查找任何公开暴露的个人可识别信息(PII),发现 5 万条此前未报告的实例。第三,自动标记由加州电力中断诉讼中的人类专家评分的法律响应邮件,发现峰值准确率达 99%。最后,我们追踪了企业危机前、中、后三年间超过 1 万独特人物的首要主题与情感。在可能处,我们将 51 种算法的准确率与执行时间比较,并报告可扩展到海量数据集的具人类可解释性的业务规则。

关键词

引用

@article{arxiv.2001.10374,
  title  = {The Enron Corpus: Where the Email Bodies are Buried?},
  author = {David Noever},
  journal= {arXiv preprint arXiv:2001.10374},
  year   = {2020}
}