中文

REFN:基于网络的强化学习框架应对1日/n日漏洞利用

机器学习 2025-08-15 v1 人工智能

摘要

1日或n日漏洞的滥用因大规模部署和延迟补丁(平均补丁时间超过60天)而构成对网络设备的严重威胁。现有的防御措施,包括基于主机的补丁和基于网络的过滤,由于在跨越多样化设备方面的可扩展性受限、尤其在嵌入式或旧式系统上的兼容性问题以及错误-prone的部署过程(手动补丁验证),显得不足。为解决这些问题,我们引入REFN(Reinforcement Learning From Network),这是一个新型框架,训练大型语言模型(LLM)自主生成网络过滤器,以防止1日或n日漏洞利用。REFN通过独特地采用基于在线网络奖励的强化学习(RL),而非传统的人类反馈(RLHF),实现可扩展性。REFN通过在边缘安全网关(Amazon Eero)上的统一部署确保兼容性。REFN通过使用真实网络流量进行在线验证来保证鲁棒性。关键的是,REFN解决了在训练LLM用于漏洞预防中面临的三个核心挑战:1)通过基于Agentic RAG的知识蒸馏扩展当前LLM有限的漏洞修复专长,2)通过一种从VNF管道将语言上下文(漏洞描述)转化为网络执行的RL方法,弥合LLM语言与网络之间的鸿沟,3)通过在线Agentic验证来解决LLM幻觉和非确定性问题,对错误输出进行惩罚。在涵盖22类1日或n日漏洞利用的评估中,REFN显示出有效性(比替代方案高出21.1%的准确率)、效率(补丁时间为3.65小时)和可扩展性(轻松扩展至1万台设备)的优势。REFN为训练LLM快速预防大规模1日或n日漏洞利用提供了第一步。

关键词

引用

@article{arxiv.2508.10701,
  title  = {REFN: A Reinforcement-Learning-From-Network Framework against 1-day/n-day Exploitations},
  author = {Tianlong Yu and Lihong Liu and Ziyi Zhou and Fudu Xing and Kailong Wang and Yang Yang},
  journal= {arXiv preprint arXiv:2508.10701},
  year   = {2025}
}