中文

不止于所见:面向可泛化网站指纹识别的语义感知流量增强框架

机器学习 2026-05-13 v1 密码学与安全 网络与互联网体系结构

摘要

基于深度学习的网站指纹识别已成为推断用户访问网站的有效技术。尽管现有方法在封闭世界数据集上取得了强大性能,但它们通常无法泛化到真实世界环境,尤其是在地理和时间偏移下。这一局限性从根本上源于两个关键挑战的耦合效应:应用层资源组成可变性和由跨层封装引起的可观测特征不稳定性。这些因素交织在一起,导致底层应用语义与可观测流量特征之间发生系统性偏移。为解决上述挑战,我们提出 SATA,一个语义感知的流量增强框架。具体来说,SATA 首先基于协议规则执行应用层语义增强,扩展每个流内的资源组成模式以及协议约束下的帧序列模式。基于这些增强的帧序列,我们进一步通过知识蒸馏引入跨层特征对齐机制。它将帧序列与数据包长度序列特征对齐,从而在增强语义和可观测序列之间实现跨层特征对齐。大量实验表明,SATA 成功生成了训练集中不存在但测试集中真实存在的流量模式,并显著提高了主流模型在多样化和复杂场景下的性能。特别是在开放世界设置中,SATA 将准确率提高了 90.81%,将 AUROC 提高了 48.37%。原型系统的源代码可在 https://anonymous.4open.science/r/SATA-B6C2/ 获取。

关键词

引用

@article{arxiv.2605.11402,
  title  = {More Than Meets the Eye: A Semantics-Aware Traffic Augmentation Framework for Generalizable Website Fingerprinting},
  author = {Youquan Xian and Xueying Zeng and Lingjia Meng and Lei Cui and Runhan Song and Wei Wang and Zhengquan Ding and Peng Liu and Zhiyu Hao},
  journal= {arXiv preprint arXiv:2605.11402},
  year   = {2026}
}

备注

18 pages, 19 figures, Submitted to NDSS 2027