中文

微调 ChemBERTa 以预测 TDP1 的抑制活性

机器学习 2025-12-05 v1 人工智能

摘要

预测小分子对酪氨酸-DNA 磷酸酶酶 1 (TDP1) - 这是一种关键靶点,用于克服癌症药抗性 - 的抑制活性, 仍是早期药物发现中的关键挑战。我们提出了基于深度学习的框架, 用于从分子简化分子输入线条系统 (SMILES) 字符串对 pIC50 值进行定量回归, 使用对 ChemBERTa 进行微调的变体。该模型是预训练的化学语言模型。我们利用包含 177,092 个化合物的大规模共识数据集, 系统评估了两种预训练策略 - 掩码语言模型 (MLM) 和掩码标记回归 (MTR) - 在分层数据分割和样本加权下以应对仅有 2.1% 为活性的严重活性不平衡问题。我们的做法在回归精度和虚拟筛选实用性方面均优于经典基线 Random Predictor, 与 Random Forest 性能相当, 在排名前列的预测中实现了高富集因子 EF@1% 17.4 和精度 Precision@1% 37.4。经过严格的消融和超参数研究验证的 resulting model 提供了一个稳健、可部署的工具, 用于优先考虑 TDP1 抑制剂进行实验测试。通过实现直接从 SMILES 进行无 3D 结构 pIC50 预测, 本工作展示了化学变压器在加速靶点特异性药物发现中的变革性潜力。

关键词

引用

@article{arxiv.2512.04252,
  title  = {Fine-Tuning ChemBERTa for Predicting Inhibitory Activity Against TDP1 Using Deep Learning},
  author = {Baichuan Zeng},
  journal= {arXiv preprint arXiv:2512.04252},
  year   = {2025}
}