分解 PROTAC 活性预测中的泛化差距:方差归因与实验室间上限
摘要
生化活性的机器学习预测器常常表现出从随机划分到留一靶点划分的巨大泛化差距,这一差距虽已被记录但未被分解。我们将此界定为一个评估科学问题,并使用靶向蛋白降解作为实证测试平台。PROTACs 是诱导靶向蛋白降解的异双功能小分子,目前有四十多种候选药物正在进行临床试验;已发表的预测器在随机划分交叉验证下报告的 AUROC 为 0.85 至 0.91,而 Ribes 等人提出的留一靶点协议将性能降低到约 0.67。随机划分奖励的是靶点内的插值,而留一靶点衡量的是全新设计所依赖的新靶点预测能力。我们分解了这一差距,并确定实验室间测量方差为主要组成部分,通过一个靶点内跨实验室级联分析,将实验室间贡献的上限定为 0.124 AUROC,远高于二值化阈值选择带来的 0.05 的贡献。在八个已发表的架构和高达 3B 参数的 ESM-2 蛋白质语言模型中,留一靶点 AUROC 稳定在 0.67 附近,在 SMILES 级别的去重下也观察到类似的上限;一个 21 维 2000 次试验的超参数优化无法突破此上限,且排名第一的单种子配置在多种子验证下性能下降了 0.161 AUROC,这与一个闭式选择偏差预测相符。结合 ADMET 特征的每靶点分层 5 样本微调将 65 个靶点的留一靶点 AUROC 从 0.668 提升至 0.7050,并且事后 Platt 缩放将原始输出恢复到 0.05 的校准良好阈值内。我们发布了 PROTAC-Bench、方差分解框架、每靶点校准协议和评估代码。
引用
@article{arxiv.2605.11764,
title = {Decomposing the Generalization Gap in PROTAC Activity Prediction: Variance Attribution and the Inter-Laboratory Ceiling},
author = {Thor Klamt and Wolfgang Nejdl and Ming Tang},
journal= {arXiv preprint arXiv:2605.11764},
year = {2026}
}
备注
32 pages, 11 figures, 11 tables. Dataset: https://huggingface.co/datasets/ThorKl/protac-bench (CC-BY-4.0). Code: https://github.com/ThorKlm/PROTAC-Bench (MIT)