中文

复现研究:基于流图输入表示的对比学习与数据增强在流量分类中的应用

机器学习 2023-10-17 v2 网络与互联网体系结构

摘要

近年来,受深度学习(DL)兴起的吸引,我们见证了人们对流量分类(TC)重新产生兴趣。然而,绝大多数 TC 文献缺乏代码工件、跨数据集的性能评估以及与机器学习(ML)方法的参照对比。在这些工作中,IMC22 的一项近期研究 [16] 值得关注,因为它采用了近期 DL 方法(即小样本学习、通过对比学习和数据增强的自监督),这些方法对网络领域颇具吸引力,因为它们能够从少量样本中学习并跨数据集迁移。文献 [16] 在 UCDAVIS19、ISCX-VPN 和 ISCX-Tor 数据集上的主要结果是,借助此类 DL 方法,使用一种称为“流图”(flowpic,即每个流的数据包大小随时间演变的二维直方图)的输入表示,100 个输入样本就足以达到非常高的准确率。在本文中,(i)我们在相同数据集上复现了 [16],(ii)我们在三个额外的公共数据集(MIRAGE19、MIRAGE22 和 UTMOBILENET21)上复现了其最显著方面(数据增强的重要性)。虽然我们确认了大部分原始结果,但也发现由于我们在原始数据集中发现的数据偏移,部分所考察场景出现了 20% 的准确率下降。此外,我们的研究验证了 [16] 中研究的数据增强策略在其他数据集上也表现良好。本着可复现性与可复制性的精神,我们在 https://tcbenchstack.github.io/tcbench/ 向研究界提供所有工件(代码与数据)。

关键词

引用

@article{arxiv.2309.09733,
  title  = {Replication: Contrastive Learning and Data Augmentation in Traffic Classification Using a Flowpic Input Representation},
  author = {Alessandro Finamore and Chao Wang and Jonatan Krolikowski and Jose M. Navarro and Fuxing Chen and Dario Rossi},
  journal= {arXiv preprint arXiv:2309.09733},
  year   = {2023}
}

备注

to appear at ACM Internet Traffic Measurement (IMC) 2023, replication track