中文

TrafficGPT:打破Token限制以实现高效的长流量分析与生成

机器学习 2024-03-19 v2

摘要

多年来,网络流量分析与生成取得了显著进展。从传统的统计方法发展到复杂的深度学习技术。这些进展提升了检测复杂模式和安全威胁的能力,以及测试和优化网络性能的能力。然而,障碍依然存在,例如分析依赖于标注数据,以及生成遵循真实模式的流量样本的困难。预训练深度神经网络已成为解决这些问题的强大工具,通过从大型无标注数据集中学习鲁棒的数据表示来提供更好的性能。尽管有其优势,现有的预训练模型面临诸如Token长度限制等挑战,这限制了它们在全面流量分析和真实流量生成中的实用性。为了应对这些挑战,我们引入了TrafficGPT,这是一种能够应对与长流分类和生成任务相关的复杂挑战的深度学习模型。该模型使用生成式预训练与线性注意力机制,使其容量从之前仅512个Token的限制大幅增加到12,032个Token。TrafficGPT在分类任务中表现出卓越的性能,达到了SOTA水平。在生成任务中,它与真实流量流高度相似,具有低JS散度,且在判别生成数据时F1分数接近0.5(代表随机猜测)。这些进展为未来在流量流分类和生成任务中的应用带来了希望。

关键词

引用

@article{arxiv.2403.05822,
  title  = {TrafficGPT: Breaking the Token Barrier for Efficient Long Traffic Analysis and Generation},
  author = {Jian Qu and Xiaobo Ma and Jianfeng Li},
  journal= {arXiv preprint arXiv:2403.05822},
  year   = {2024}
}