面向开源权重生物基础模型的双风险评估最佳实践
密码学与安全
2025-11-24 v4 人工智能
摘要
开源权重生物基础模型面临双重风险。尽管它们在加速科学研究和药物开发方面具有巨大潜力,但也可能被恶意行为者用于开发更致命的生物武器。为缓解这些模型所带来的风险,当前方法侧重于在预训练期间过滤有生物危害性的数据。然而,这种方法的有效性尚不明确,特别是针对可能通过微调这些模型进行恶意使用的行为。为填补这一空白,我们提出 BioRiskEval 框架,用于评估旨在减少生物基础模型双重能力的程序的鲁性。BioRiskEval 通过三个层面评估模型的病毒理解能力,包括序列建模、突变效应预测和致病性预测。我们的结果表明,当前的过滤实践可能并不 particularly effective:在某些情况下,通过微调可以快速恢复被排除的知识,并且在序列建模中展现更广泛的可泛化性。此外,双重风险信号可能已经存在于预训练的表示中,并且可以通过简单的线性探测来激发。这发现突显了数据过滤作为单一程序的挑战,强调了进一步研究面向开源权重生物基础模型的稳健安全和安全策略的必要性。
关键词
引用
@article{arxiv.2510.27629,
title = {Best Practices for Biorisk Evaluations on Open-Weight Bio-Foundation Models},
author = {Boyi Wei and Zora Che and Nathaniel Li and Udari Madhushani Sehwag and Jasper Götting and Samira Nedungadi and Julian Michael and Summer Yue and Dan Hendrycks and Peter Henderson and Zifan Wang and Seth Donoughe and Mantas Mazeika},
journal= {arXiv preprint arXiv:2510.27629},
year = {2025}
}
备注
17 Pages, 5 figures