中文

PoC-Adapt:基于LLM多智能体与强化学习驱动自适应策略的语义感知自动化漏洞复现

密码学与安全 2026-04-10 v2

摘要

尽管近期方法利用大语言模型(LLM)和多智能体流水线从漏洞报告自动生成概念验证(PoC)漏洞利用,但现有系统常存在两个根本性局限:基于表面执行信号的不可靠验证,以及漏洞生成过程中大量试错导致的高操作成本。本文提出PoC-Adapt,一个端到端的自动化PoC生成与验证框架,其架构基于语义运行时验证与自适应策略学习。PoC-Adapt的核心是一个语义Oracle,通过比较结构化的执行前后系统状态来验证漏洞利用,从而可靠地区分真正的漏洞利用与偶然的行为变化。为降低探索成本,我们进一步引入自适应策略学习机制,该机制在语义状态与动作上学习漏洞利用策略,引导漏洞利用智能体以更少的失败尝试找到有效策略。PoC-Adapt实现为一个多智能体系统,包含用于根因分析、环境构建、漏洞利用生成和语义验证的专门智能体,通过结构化反馈循环进行协调。在CWE-Bench-Java和PrimeVul基准上的实验表明,PoC-Adapt将验证可靠性显著提升了25%,并降低了漏洞生成成本,凸显了语义验证与学习到的动作策略在自动化漏洞复现中的重要性。应用于最新CVE语料库,PoC-Adapt在80次复现尝试中确认了12个已验证的PoC,每次生成漏洞利用的成本为0.42美元。

关键词

引用

@article{arxiv.2604.06618,
  title  = {PoC-Adapt: Semantic-Aware Automated Vulnerability Reproduction with LLM Multi-Agents and Reinforcement Learning-Driven Adaptive Policy},
  author = {Phan The Duy and Khoa Ngo-Khanh and Nguyen Huu Quyen and Van-Hau Pham},
  journal= {arXiv preprint arXiv:2604.06618},
  year   = {2026}
}

备注

16 pages, abstracted and meta updated