ToxBench:用于人类雌激素受体α的AB-FEP计算标签的结合亲和力预测基准
机器学习
2025-07-15 v1 人工智能
化学物理
生物大分子
摘要
蛋白质-配体结合亲和力预测是药物发现和毒性评估中至关重要的任务。虽然机器学习(ML)有望实现快速而准确的预测,但其进展受到可靠数据可得性的限制。相比之下,基于物理的方法,如绝对结合自由能扰动(AB-FEP)能提供高准确度,但对于高通量应用是计算昂贵的。为填补这一差距,我们介绍了ToxBench,即首个为ML开发而设计的大规模AB-FEP数据集,专注于单个药学关键靶点——人类雌激素受体α(ERα)。ToxBench包含8,770个ERα-配体复合物结构,其结合自由能通过AB-FEP计算,部分验证了实验亲和力,RMSE为1.75 kcal/mol,同时包括非重叠的配体划分以评估模型的可泛性。使用ToxBench,我们进一步对比了最先进的ML方法,其中包括我们提出的DualBind模型,该模型采用双损失框架有效地学习结合能函数。基准结果显示DualBind的性能优于其他方法,证明了机器学习在折中计算成本的情况下模拟AB-FEP的潜力。
引用
@article{arxiv.2507.08966,
title = {ToxBench: A Binding Affinity Prediction Benchmark with AB-FEP-Calculated Labels for Human Estrogen Receptor Alpha},
author = {Meng Liu and Karl Leswing and Simon K. S. Chu and Farhad Ramezanghorbani and Griffin Young and Gabriel Marques and Prerna Das and Anjali Panikar and Esther Jamir and Mohammed Sulaiman Shamsudeen and K. Shawn Watts and Ananya Sen and Hari Priya Devannagari and Edward B. Miller and Muyun Lihan and Howook Hwang and Janet Paulsen and Xin Yu and Kyle Gion and Timur Rvachov and Emine Kucukbenli and Saee Gopal Paliwal},
journal= {arXiv preprint arXiv:2507.08966},
year = {2025}
}
备注
Workshop on Generative AI for Biology at ICML 2025