BioVeil MATRIX:剥离代理生物学 AI 科学家的漏洞发现与分类
其他定量生物学
2026-05-05 v1
摘要
具备特定领域工具的代理型 AI 科学家正快速进入跨学科科研工作流程,尤其在生命科学领域,可用于文献综述、序列分析和实验规划支持。尽管这些系统加速了生物学研究,但也引入了当前模型中心安全评估无法捕捉的双用途风险。我们提供证据表明,当前代理型 AI 科学家(包括 Biomni 和 K-Dense)愿意协助那些被基座模型安全措施阻止的双用途任务。我们也发现,在涉及大量毁灭性武器代理 (WMDP) 的生物学和化学提示的配对评估框架中,Biomni 的代理级架构相对于底层独立模型提升了基准性能,产生可衡量的能力提升。我们认为必须在现有模型中加入额外的安全措施,并从一开始就以代理漏洞为设计目标构建未来工具。为系统性地分类更广泛的风险,我们提出了 BioVeil MATRIX,一套防御性分类法,通过 10 个战术类别 (TA01-TA10) 和 22 种不同技术映射 AI 启用生物安全风险。我们建议将此分类法作为未来 AI 科学家开发的基准,并生成针对这些漏洞的专门基准和红队测试协议。BioVeil MATRIX 可在 https://bioveilmatrix.com/ 查阅。
引用
@article{arxiv.2605.00927,
title = {BioVeil MATRIX: Uncovering and categorizing vulnerabilities of agentic biological AI scientists},
author = {Kimon Antonios Provatas and Avery Self and Ioannis Mouratidis and Ilias Georgakopoulos-Soares},
journal= {arXiv preprint arXiv:2605.00927},
year = {2026}
}