基于漂移的数据集稳定性基准
机器学习
2026-01-01 v1 人工智能
网络与互联网体系结构
摘要
机器学习(ML)是网络流量分类中一种高效且流行的方法。然而,网络流量分类是一个极具挑战性的领域,由于数据集过时以及计算机网络随新协议或更新协议的出现而快速演进,训练后的模型在部署后不久便可能性能下降。此外,流量类型行为的显著变化(以及代表该流量的底层特征的变化)会导致已部署模型出现大幅且突然的性能下降,这被称为数据漂移或概念漂移。在大多数情况下,会进行完全重训练,且通常由于假设数据集质量良好而不再进一步调查根本原因。然而,情况并非总是如此,必须进行进一步调查。本文提出了一种评估数据集稳定性的新方法,以及一个可用于比较数据集的基准工作流。所提出的框架基于一种概念漂移检测方法,该方法还利用 ML 特征权重来提升检测性能。该工作的益处在 CESNET-TLS-Year22 数据集上得到了验证。我们提供了初始的数据集稳定性基准,用于描述数据集的稳定性与薄弱环节,以确定下一步的优化方向。最后,使用所提出的基准方法,我们展示了优化对所创建数据集变体的影响。
引用
@article{arxiv.2512.23762,
title = {Drift-Based Dataset Stability Benchmark},
author = {Dominik Soukup and Richard Plný and Daniel Vašata and Tomáš Čejka},
journal= {arXiv preprint arXiv:2512.23762},
year = {2026}
}
备注
9 pages