利用在线可信度与性能数据并考虑类不平衡问题的恶意网页域名识别
机器学习
2018-10-22 v1 密码学与安全
神经与进化计算
机器学习
摘要
目的:恶意网页域名识别对互联网用户的安全防护具有重要意义。利用在线可信度与性能数据,本文旨在考虑类不平衡问题(即良性网页域名多于恶意网页域名)的情况下,研究机器学习技术在恶意网页域名识别中的使用。设计/方法/途径:我们提出一种集成重采样方法,通过结合合成少数类过采样技术(SMOTE)和粒子群优化(PSO,一种基于种群的元启发式算法)来处理类不平衡。我们使用SMOTE进行过采样,使用PSO进行欠采样。研究发现:通过应用八种知名的机器学习分类器,所提出的集成重采样方法使用多个具有不同不平衡比例的不平衡网页域名数据集进行了全面检验。与五种其他知名重采样方法相比,实验结果证实所提方法非常有效。实践意义:本研究不仅启发了利用在线可信度与性能数据识别恶意网页域名的实际应用,也为恶意网页域名识别领域处理类不平衡问题提供了有效的重采样方法。原创性/价值:应用在线可信度与性能数据,利用机器学习技术构建恶意网页域名识别模型。提出一种集成重采样方法以解决类不平衡问题。基于具有不同不平衡比例的真实世界数据集,证实了所提方法的性能。
引用
@article{arxiv.1810.08359,
title = {Malicious Web Domain Identification using Online Credibility and Performance Data by Considering the Class Imbalance Issue},
author = {Zhongyi Hu and Raymond Chiong and Ilung Pranata and Yukun Bao and Yuqing Lin},
journal= {arXiv preprint arXiv:1810.08359},
year = {2018}
}
备注
20 pages