面向生命周期大语言模型生物安全对齐的生物安全智能体
密码学与安全
2025-10-14 v1
摘要
大语言模型(LLMs)正日益融入生物医学研究工作流程——从文献筛选、假设生成到实验设计——然而,这种扩展的实用性也加剧了双重用途的担忧,包括可能被滥用于指导有毒化合物的合成。为此,本研究展示了一个生物安全智能体,该智能体在模型生命周期内包含四种协调模式:数据集消毒、偏好对齐、运行时防护栏和自动化红队测试。对于数据集消毒(模式1),我们在CORD-19(一个关于冠状病毒相关学术文章的COVID-19开放研究数据集)上进行了评估。我们定义了三个消毒层级——L1(紧凑、高精度)、L2(人工策划的生物安全术语)和L3(全面联合)——移除率从0.46%上升到70.40%,说明了安全性与实用性之间的权衡。对于偏好对齐(模式2),结合LoRA适配器的DPO将拒绝和安全完成内化,将端到端攻击成功率(ASR)从59.7%降低到3.0%。在推理阶段(模式3),跨L1-L3的运行时防护栏显示了预期的安全性与可用性权衡:L2实现了最佳平衡(F1 = 0.720,精确率 = 0.900,召回率 = 0.600,FPR = 0.067),而L3以更高的误报率为代价提供了更强的越狱抵抗能力。在持续的自动化红队测试(模式4)下,在测试协议中未观察到成功的越狱。综上所述,我们的生物安全智能体提供了一个可审计的、生命周期对齐的框架,在保持良性实用性的同时降低了攻击成功率,为LLMs在科学研究中的使用提供了保障,并为未来的智能体级安全保护树立了先例。
引用
@article{arxiv.2510.09615,
title = {A Biosecurity Agent for Lifecycle LLM Biosecurity Alignment},
author = {Meiyin Meng and Zaixi Zhang},
journal= {arXiv preprint arXiv:2510.09615},
year = {2025}
}