中文

偏见隐藏之下:探索加密网络流量分类中的捷径

机器学习 2026-01-16 v1 网络与互联网体系结构

摘要

直接作用于原始字节的预训练模型在加密网络流量分类(NTC)中取得了有前景的性能,但常因捷径学习问题而受影响,即依赖于不具备常识性的相关性,导致其在现实世界数据上难以泛化。现有解决方案严重依赖于模型特定的解释技术,这些技术在不同模型架构和部署场景下缺乏适应性和通用性。本文提出了 BiasSeeker——第一个在加密流量中检测数据特定捷径特征的半自动化框架,具有模型无关性和数据驱动性。通过对原始二进制流量进行统计相关性分析,BiasSeeker 能独立于任何分类器,识别出可能损害泛化性的伪相关或环境耦合特征。为应对捷径特征的多样性,我们引入了系统性的分类方法,并针对不同类别应用特定的验证策略,以减少偏见同时保留有意义的信息。我们在三个 NTC 任务中对 19 个公开数据集进行评估。通过强调上下文感知特征选择和数据集特定的诊断,BiasSeeker 为理解和应对加密网络流量分类中的捷径学习提供了新的视角,提醒在模型训练前特征选择应是一种有意识且场景敏感的步骤。

关键词

引用

@article{arxiv.2601.10180,
  title  = {Bias in the Shadows: Explore Shortcuts in Encrypted Network Traffic Classification},
  author = {Chuyi Wang and Xiaohui Xie and Tongze Wang and Yong Cui},
  journal= {arXiv preprint arXiv:2601.10180},
  year   = {2026}
}