中文

CyberChainBench:AI智能体能否保护智能合约免受真实世界链上漏洞的攻击?

密码学与安全 2026-06-24 v1 人工智能

摘要

我们提出了CyberChainBench,一个用于评估基于LLM的智能体在智能合约安全方面的基准,涵盖三个互补任务:漏洞检测、漏洞利用生成和补丁合成。该基准基于DeFiHackLabs的541起真实世界漏洞利用事件,跨越9条EVM链,提供端到端的链上评估,其中智能体通过由Harbor编排的隔离评估环境与历史区块链状态交互,使用工具读取代码、追踪交易并在主网分叉上验证漏洞利用。每个案例锚定到特定区块,并包含涵盖漏洞类型、定位和攻击者利润的结构化真实数据。漏洞利用根据历史分叉上的经济影响进行评分;补丁通过在代理可升级子集上重放历史攻击和合法交易作为失败转通过测试预言机进行验证。我们定义了一个五类漏洞分类法,并评估了多种智能体-模型配置。结果揭示了明显的难度梯度:最佳配置在检测上得分37.5%,在利用上得分43.7%,但在修补上仅得分23.4%,顶级智能体(Codex与GPT-5.5)在200个案例的利用集上实现了总计5740万美元的利用利润,每个案例成本为2.39美元。

关键词

引用

@article{arxiv.2606.26216,
  title  = {CyberChainBench: Can AI Agents Secure Smart Contracts Against Real-World On-Chain Vulnerabilities?},
  author = {Jintao Huang and Fengqing Jiang and Radha Poovendran and Zhiqiang Lin},
  journal= {arXiv preprint arXiv:2606.26216},
  year   = {2026}
}