美国外交电文的自动安全分类:主题模型剪枝与基于聚类的分类方法比较
密码学与安全
2017-03-08 v1
摘要
美国政府一直是全球网络攻击的目标。就在最近,前总统奥巴马指责俄罗斯政府向维基解密泄露电子邮件,并宣称美国可能被迫做出回应。尽管俄罗斯否认参与,但显然美国必须采取一些防御措施来保护其数据基础设施。内部人员威胁也是其他敏感信息泄露的原因,包括臭名昭著的爱德华·斯诺登事件。最近的泄露大多以文本形式出现。由于文本数据的性质,安全分类是手动分配的。在对抗环境中,内部人员可以通过电子邮件、打印机或任何不受信任的渠道泄露文本。最佳防御措施是自动检测非结构化文本的安全类别,并强制执行适当的保护机制,而不降低服务或影响日常任务。遗憾的是,现有的数据泄露防护(Data Leak Prevention, DLP)系统并不适合检测非结构化文本。在本文中,我们比较了文献中两种最新的文本安全分类方法,并在来自维基解密数据集的真实敏感文本数据上对它们进行了评估。
引用
@article{arxiv.1703.02248,
title = {Automated U.S Diplomatic Cables Security Classification: Topic Model Pruning vs. Classification Based on Clusters},
author = {Khudran Alzhrani and Ethan M. Rudd and C. Edward Chow and Terrance E. Boult},
journal= {arXiv preprint arXiv:1703.02248},
year = {2017}
}
备注
Pre-print of camera-ready copy accepted to the 2017 IEEE Homeland Security Technologies (HST) conference