中文

L2M-AID:融合大语言模型语义推理与多智能体强化学习的自主工业防御

人工智能 2025-10-15 v2

摘要

工业物联网 (IIoT) 的日益融合使关键网络-物理系统面临能克服传统防御缺乏情境感知能力的高级多阶段攻击。本文引入 L2M-AID,一个新型工业防御框架,利用以大语言模型驱动的多智能体强化学习实现自主防御。L2M-AID 编排由一支由大语言模型驱动的协作智能体团队,以实现适应性与韧性的安全。核心创新在于两种人工智能范式的深度融合:我们利用大语言模型作为语义桥梁,将海量非结构化遥测数据转化为丰富的情境状态表示,使智能体能够对对手意图进行推理,而不仅仅是匹配模式。这种语义感知的状态使多智能体强化学习 (MAPPO) 算法能够学习复杂的合作策略。MAPPO 奖励函数独特地平衡了安全目标(威胁中和)与操作需求,显式惩罚干扰物理过程稳定性的行为。为验证我们的方法,我们在基准 SWaT 数据集和基于 MITRE ATT&CK for ICS 框架生成的新型合成数据集上进行了大规模实验。结果表明,L2M-AID 在关键指标上显著优于传统入侵检测系统、深度学习异常检测器和单智能体强化学习基线,实现 97.2% 检测率,误报率降低超过 80%,响应速度提升约四倍。关键是,它在维持物理过程稳定性方面表现出优越性能,为保障关键国家基础设施提供了稳健的新范式。

关键词

引用

@article{arxiv.2510.07363,
  title  = {L2M-AID: Autonomous Cyber-Physical Defense by Fusing Semantic Reasoning of Large Language Models with Multi-Agent Reinforcement Learning (Preprint)},
  author = {Tianxiang Xu and Zhichao Wen and Xinyu Zhao and Jun Wang and Yan Li and Chang Liu},
  journal= {arXiv preprint arXiv:2510.07363},
  year   = {2025}
}

备注

This preprint was submitted to IEEE TrustCom 2025. The accepted version will be published under copyright 2025 IEEE