深度学习与流量分类:来自包含数百种加密与零日应用的商业级数据集的经验教训
机器学习
2021-09-28 v2 网络与互联网体系结构
摘要
机器学习(ML)和深度学习(DL)日益增长的成最近重新引发了人们对流量分类的兴趣。虽然已知流量的分类是一个被充分研究的问题,且已知监督分类工具(如 ML 和 DL 模型)能提供令人满意的性能,但未知(或零日)流量的检测更具挑战性,通常由无监督技术(如聚类算法)处理。在本文中,我们分享了一个商业级 DL 流量分类引擎的经验,该引擎能够(i)从加密流量中识别已知应用,以及(ii)处理未知的零日应用。具体而言,对于(i)我们的贡献是在包含几千个非常细粒度应用标签的商业级设置下对最先进的流量分类器进行全面评估,这与学术评估中通常针对的几十个类别相反。此外,我们通过提出一种专为 DL 模型定制的新技术,对(ii)零日应用检测问题做出贡献,该技术比最先进技术显著更准确且更轻量。总结我们的主要发现,我们认识到(i)虽然 ML 和 DL 模型都能同样为已知流量分类提供令人满意的解决方案,但(ii)DL 骨干的非线性特征提取过程为未知类的检测提供了可观的优势。
引用
@article{arxiv.2104.03182,
title = {Deep Learning and Traffic Classification: Lessons learned from a commercial-grade dataset with hundreds of encrypted and zero-day applications},
author = {Lixuan Yang and Alessandro Finamore and Feng Jun and Dario Rossi},
journal= {arXiv preprint arXiv:2104.03182},
year = {2021}
}