使用机器学习、Transformer 和大语言模型进行网络流量分类
机器学习
2025-03-05 v1 计算与语言
密码学与安全
摘要
本研究使用多种模型处理网络流量分类问题,将流量分为网页、浏览、IPSec、备份和电子邮件。我们从 Arbor Edge Defender (AED) 设备收集了一个包含 30,959 条观测数据和 19 个特征的综合数据集。评估了多个模型,包括朴素贝叶斯、决策树、随机森林、梯度提升、XGBoost、深度神经网络 (DNN)、Transformer,以及包含 GPT-4o 和 Gemini 在内的两个大语言模型 (LLM),并采用了零样本和少样本学习。Transformer 和 XGBoost 表现出最佳性能,分别实现了 98.95% 和 97.56% 的最高准确率。GPT-4o 和 Gemini 在少样本学习中表现出可喜的结果,与初始零样本性能相比准确率有显著提升。虽然 Gemini Few-Shot 和 GPT-4o Few-Shot 在网页和电子邮件等类别中表现良好,但在 IPSec 和备份等更复杂的类别中出现了误分类。该研究强调了模型选择、微调以及训练数据规模与模型复杂性之间平衡的重要性,以实现可靠的分类结果。
引用
@article{arxiv.2503.02141,
title = {Network Traffic Classification Using Machine Learning, Transformer, and Large Language Models},
author = {Ahmad Antari and Yazan Abo-Aisheh and Jehad Shamasneh and Huthaifa I. Ashqar},
journal= {arXiv preprint arXiv:2503.02141},
year = {2025}
}