SafeBench-Seq:基于同源聚类、CPU 端的蛋白质危险筛选基准,采用物理化学/组成特征与聚类感知置信区间
机器学习
2025-12-22 v1 人工智能
密码学与安全
摘要
蛋白质设计的 foundation 模型提出具体的生物安全风险,但社区缺乏一个简单、可重复的用于序列层面危险筛选的基准,在同源控制下进行显式评估,并且运行在普通 CPU 上。我们引入 SafeBench-Seq,这是一个仅包含元数据的、可重复的基准和基线分类器,完全基于公共数据构建(SafeProtein 危险数据和 UniProt良性数据),并使用可解释特征(全局物理化学描述符和氨基酸组成)。为近似「从未见过」的威胁,我们对合并后的数据集进行同源聚类(<=40% 同源性),并执行聚类级别的 holdout(训练/测试集之间无聚类重叠)。我们报告了区分度(AUROC/AUPRC)和筛选操作点(TPR@1% FPR;FPR@95% TPR),并给出 95% bootstrap 置信区间(n=200),通过 CalibratedClassifierCV 提供校准概率(Logistic Regression / Random Forest 采用 isotonic 分段;Linear SVM 采用 Platt sigmoid)。我们使用 Brier 分数、预期校准误差(ECE;15 个分箱)和可靠性图量化概率质量。通过组成保留性残基随机置换和长度/组成-only 消融实验探测捷径 susceptibility。实验表明,随机划分显著高估了在同源聚类评估下的鲁棒性;校准的线性模型表现出较好的校准,而树集成模型保留略高的 Brier/ECE。SafeBench-Seq 完全基于 CPU 实现、可重复,并仅发布元数据(accession 编号、cluster ID、split 标签),在不分发危险序列的前提下实现严格评估。
引用
@article{arxiv.2512.17527,
title = {SafeBench-Seq: A Homology-Clustered, CPU-Only Baseline for Protein Hazard Screening with Physicochemical/Composition Features and Cluster-Aware Confidence Intervals},
author = {Muhammad Haris Khan},
journal= {arXiv preprint arXiv:2512.17527},
year = {2025}
}