中文

SafeProtein:面向蛋白基础模型的红队测试框架与基准

机器学习 2025-10-09 v2 人工智能 密码学与安全 生物大分子 定量方法

摘要

蛋白质在几乎所有生物学过程中都发挥着关键作用。深度学习的发展极大地推动了蛋白基础模型的发展,使其在蛋白理解与设计方面取得了显著成果。然而,由于缺乏对这些模型进行系统性红队测试,引发了严重担忧,如这些模型可能被用于生成具有生物安全风险的蛋白质。本文介绍了SafeProtein,作为我们所知目前最佳的,面向蛋白基础模型的首个红队测试框架。SafeProtein结合多模态提示工程和启发式束搜索,系统性地设计了红队测试方法并对蛋白基础模型进行测试。我们还策划了SafeProtein-Bench,包括手动构建的红队测试基准数据集和全面的评估协议。SafeProtein在最先进的蛋白基础模型上实现了持续的越狱(针对ESM3的最高攻击成功率可达70%),揭示了当前蛋白基础模型可能存在的生物安全风险,并为开发面向前沿模型的健壮安全保护技术提供了洞见。代码将公开发布于 https://github.com/jigang-fan/SafeProtein。

关键词

引用

@article{arxiv.2509.03487,
  title  = {SafeProtein: Red-Teaming Framework and Benchmark for Protein Foundation Models},
  author = {Jigang Fan and Zhenghong Zhou and Ruofan Jin and Le Cong and Mengdi Wang and Zaixi Zhang},
  journal= {arXiv preprint arXiv:2509.03487},
  year   = {2025}
}