中文

面向网络安全与物联网设备数据处理的基于 PCA 的新型类别编码器

机器学习 2022-05-24 v2

摘要

提高类别变量的基数可能会降低机器学习(ML)算法的整体性能。本文提出一种新颖的计算预处理方法,将类别变量转换为 ML 算法可用的数值变量。它使用有监督二分类器从类别值中提取额外的上下文相关特征。根据主成分分析(PCA)所实现的压缩程度,每个类别变量最多生成两个数值变量。该方法需要两个超参数:与变量中类别分布相关的阈值以及 PCA 代表性。本文将所提方法应用于知名的网络安全 NSLKDD 数据集,以选择并将三个类别特征转换为数值特征。选定阈值参数后,我们利用条件概率将三个类别变量转换为六个新数值变量。随后,将这些数值变量输入 PCA 算法,并选取全部或部分主成分(PCs)。最后,通过采用十种不同分类器进行二分类,我们度量了新编码器的性能,并与其它 17 种知名类别编码器进行比较。该新技术在高基数类别变量上取得了最高的准确率与曲线下面积(AUC)相关性能。此外,我们定义了调和平均度量,以寻找训练与测试性能之间的最佳权衡并防止欠拟合与过拟合。最终,新创建的数值变量数量极少。这种数据缩减改善了未来电信网络中物联网(IoT)设备的计算处理时间。

关键词

引用

@article{arxiv.2111.14839,
  title  = {New PCA-based Category Encoder for Cybersecurity and Processing Data in IoT Devices},
  author = {Hamed Farkhari and Joseanne Viana and Luis Miguel Campos and Pedro Sebastiao and Luis Bernardo},
  journal= {arXiv preprint arXiv:2111.14839},
  year   = {2022}
}

备注

6 pages, 4 figures, 5 tables