弥合差距:关于桥接机器学习与信息安全之间的语义鸿沟
密码学与安全
2020-05-06 v1 机器学习
机器学习
摘要
尽管机器学习(ML)在学习恶意软件行为、检测新型恶意软件样本以及显著改善信息安全(InfoSec)方面具有潜力,但尽管公开文献中报告了多次成功,我们在已部署系统中却很少见到高影响力的 ML 技术。我们假设,ML 未能在 InfoSec 中产生高影响力的根源在于两个社区之间的脱节,这表现为一种语义鸿沟——即描述可执行文件的方式(例如,从数据中提取的数据和特征)存在差异。具体来说,ML 当前使用的数据集和表示法不适合学习可执行文件的行为,并且与 InfoSec 社区使用的数据集和表示法存在显著差异。在本文中,我们调查了 ML 算法用于恶意软件分类的现有数据集以及从数据中提取的特征。我们观察到:1) 当前提取的特征集主要是语法性的,而非行为性的;2) 数据集通常包含极端样本,从而产生了一个易于区分类别的数据集;3) 这些数据集提供了与现实世界系统中遇到的数据显著不同的表示。为了使 ML 在 InfoSec 社区产生更大影响,需要改变用于弥合当前语义鸿沟的数据(包括特征和标签)。作为实现更多行为分析的第一步,我们利用与恶意软件家族相关的开源威胁报告,为现有恶意软件数据集标注了行为特征。这种行为标注将分析从识别意图(例如,好与坏)或恶意软件家族归属,转变为分析可执行文件表现出哪些行为。我们提供这些标注,希望能激发未来在数据方面的改进,从而进一步弥合 ML 和 InfoSec 社区之间的语义鸿沟。
引用
@article{arxiv.2005.01800,
title = {Mind the Gap: On Bridging the Semantic Gap between Machine Learning and Information Security},
author = {Michael R. Smith and Nicholas T. Johnson and Joe B. Ingram and Armida J. Carbajal and Ramyaa Ramyaa and Evelyn Domschot and Christopher C. Lamb and Stephen J. Verzi and W. Philip Kegelmeyer},
journal= {arXiv preprint arXiv:2005.01800},
year = {2020}
}
备注
14 pages, 2 Figures, 6 tables