中文

pForest:基于随机森林的网络内推理

网络与互联网体系结构 2022-09-08 v2

摘要

在对网络流量进行分类时,一个关键挑战是决定何时执行分类,即经过多少个数据包之后。过早,则决策依据过于单薄而无法自信地分类一条流;过晚,则滞后的标记会延迟关键动作(例如关停攻击)并长时间耗费计算资源(例如跟踪和存储特征)。此外,最优决策时机因流而异。我们提出 pForest,一个基于可编程数据平面上的监督机器学习模型、实现“尽可能早”(ASAP)网络内分类的系统。pForest 在每条流的标签足够确定时自动对其分类,不早不晚。pForest 背后的关键挑战是为流的生命周期内动态适配特征与分类逻辑寻找策略。pForest 通过以下方式解决该问题:(i)训练适用于流不同阶段的随机森林模型;以及(ii)实时地基于每个数据包在这些模型间动态切换。pForest 模型经过调优以适配可编程交换机的限制(例如无浮点、无循环、有限内存),同时提供高准确率。我们在 Python(训练)和 P4(推理)中实现了 pForest 原型。我们的评估表明,pForest 能为数十万条流尽可能早地分类流量,且分类得分与基于软件的方案相当。

关键词

引用

@article{arxiv.1909.05680,
  title  = {pForest: In-Network Inference with Random Forests},
  author = {Coralie Busse-Grawitz and Roland Meier and Alexander Dietmüller and Tobias Bühler and Laurent Vanbever},
  journal= {arXiv preprint arXiv:1909.05680},
  year   = {2022}
}

备注

update results and text