多智能体LLM治理用于SDN-IoT防御中的安全双时间尺度强化学习
组合数学
2026-04-02 v1
摘要
软件定义网络(SDN)因其集中控制和可编程转发而越来越多地被用于保护物联网(IoT)网络。然而,SDN-IoT防御本质上是一个闭环控制问题,缓解措施会影响控制器负载、队列动态、规则安装延迟和未来流量观测。激进的缓解措施可能使控制平面不稳定,降低服务质量(QoS),并放大系统性风险。现有的基于学习的方法优先考虑检测准确性,同时忽视了控制器耦合和缺乏结构化、可审计策略演化的短时域强化学习(RL)优化。本论文提出了一种自反思的双时间尺度SDN-IoT防御方案,将快速缓解与慢速策略治理分离。在快速时间尺度上,每个交换机的近端策略优化(PPO)智能体在安全约束和动作屏蔽下执行控制器感知的缓解。在慢速时间尺度上,多智能体大语言模型(LLM)治理引擎生成对全局策略宪法Pi的机器可解析更新,Pi编码了允许的动作、安全阈值和奖励优先级。更新(Delta Pi)经过压力测试验证,仅在非回归和安全保证下部署,确保可审计的演化而无需重新训练RL智能体。在异构IoT流量和对抗性压力下的评估显示,相比PPO的Macro-F1提升9.1%,相比静态基线提升15.4%。最坏情况退化降低36.8%,控制器积压峰值降低42.7%,在高强度攻击下RTT p95膨胀保持在5.8%以下。策略演化在五个周期内收敛,将灾难性过载从11.6%降至2.3%。
引用
@article{arxiv.2604.01126,
title = {Between proper and square colorings of planar graphs with maximum degree at most four},
author = {Xujun Liu and Zihui Xu and Xin Zhang},
journal= {arXiv preprint arXiv:2604.01126},
year = {2026}
}