当简单模型就够用时:网络流量分类是否正陷入危机?
机器学习
2025-06-11 v1 网络与互联网体系结构
摘要
机器学习已被应用于网络流量分类(TC)已有二十余年。虽然早期方法使用浅层模型,但后来 2010 年代的研究转向使用复杂的神经网络,常报告接近完美的准确率。然而,最近有研究指出,使用基于数据包序列元数据(大小、时间和方向)的简单 k-NN 基线方法可以与更复杂的方法持平,甚至超过。本文进一步检验了这一现象,并在 12 个数据集和 15 个 TC 任务上评估了该基线方法,进而探讨其运行良好的原因。我们的分析表明,大多数数据集包含超过 50% 的冗余样本(相同的网络数据包序列),这些冗余样本由于常见的划分实践经常出现在训练集和测试集中。这可能导致模型性能被高估,并降低理论上最大准确率(当相同流具有冲突标签时)。鉴于其独特特征,我们进一步认为,标准机器学习实践(如从 NLP 或计算机视觉领域引入)可能不适用于 TC。最后,我们提出新的任务表述和评估方向,以解决这些挑战,帮助重新定位该领域。
引用
@article{arxiv.2506.08655,
title = {When Simple Model Just Works: Is Network Traffic Classification in Crisis?},
author = {Kamil Jerabek and Jan Luxemburk and Richard Plny and Josef Koumar and Jaroslav Pesek and Karel Hynek},
journal= {arXiv preprint arXiv:2506.08655},
year = {2025}
}