GeneBreaker:在致病性引导下针对 DNA 语言模型的越狱攻击
密码学与安全
2025-06-02 v1 基因组学
摘要
DNA 为几乎所有生物体编码遗传指令,推动了基因组学和合成生物学领域的突破性进展。最近,DNA 基础模型在设计合成功能性 DNA 序列甚至全基因组方面取得了成功,但它们对越狱攻击的易感性仍未得到充分探索,这引发了生成有害序列(如病原体或产毒基因)的潜在担忧。在本文中,我们介绍了 GeneBreaker,这是第一个系统评估 DNA 基础模型越狱漏洞的框架。GeneBreaker 采用了:(1)配备定制生物信息学工具的 LLM 智能体,用于设计高同源性、非致病性的越狱提示;(2)由 PathoLM 和对数概率启发式方法引导的束搜索,以将生成导向类似病原体的序列;(3)基于 BLAST 的评估流水线,针对精选的人类病原体数据库(JailbreakDNABench)检测成功的越狱。在我们构建的 JailbreakDNABench 上进行评估,GeneBreaker 在 6 个病毒类别中持续成功越狱最新的 Evo 系列模型(Evo2-40B 的攻击成功率高达 60%)。对 SARS-CoV-2 刺突蛋白和 HIV-1 包膜蛋白的进一步案例研究证明了越狱输出的序列和结构保真度,而 SARS-CoV-2 的演化建模突显了生物安全风险。我们的研究结果还表明,扩大 DNA 基础模型的规模会放大其双重用途风险,这促使我们需要增强的安全对齐和追踪机制。我们的代码位于 https://github.com/zaixizhang/GeneBreaker。
引用
@article{arxiv.2505.23839,
title = {GeneBreaker: Jailbreak Attacks against DNA Language Models with Pathogenicity Guidance},
author = {Zaixi Zhang and Zhenghong Zhou and Ruofan Jin and Le Cong and Mengdi Wang},
journal= {arXiv preprint arXiv:2505.23839},
year = {2025}
}