机器学习评估:对网络安全的影响
机器学习
2022-12-20 v5 机器学习
摘要
本章致力于机器学习(ML)算法的评估与性能估计,这一主题与这些算法的构建同等重要,尤其在网络物理安全设计背景下。文献中充满了通过重采样技术(如刀切法、自助法、交叉验证(CV))从单一可用数据集估计统计量的非参数方法。备受关注的特殊统计量包括分类规则的误分率与 ROC 曲线下面积(AUC)。这些重采样方法的重要性在于无需知道数据的概率分布或 ML 算法的构建细节。本章简明回顾该文献,为能够同时估计误分率(单样本统计量)与 AUC(双样本统计量)的这些方法建立连贯的理论框架。重采样方法通常计算昂贵,因其依赖于在每次重采样迭代后重复 ML 算法的训练与测试。因此,其中部分方法的实际适用性可能限于传统 ML 算法,而非近期深度神经网络(DNN)的极高计算需求方法。在网络物理安全领域,许多应用生成结构化(表格)数据,可输入所有传统 ML 方法。这与偏好非结构化数据(如图像、文本、语音等)的 DNN 方法形成对比;因此本章对该领域具有相关性。
引用
@article{arxiv.1907.12851,
title = {Machine Learning Assessment: implications to cybersecurity},
author = {Waleed A. Yousef},
journal= {arXiv preprint arXiv:1907.12851},
year = {2022}
}