优化药物而非补全药物:用于基于片段药物发现的均匀源离散流
机器学习
2025-10-01 v1
摘要
我们引入了 InVirtuoGen,这是一种针对片段化 SMILES 的离散流生成模型,用于小分子的从头生成和片段约束生成,以及目标属性/先导化合物优化。该模型学习将所有可能 token 上的均匀源转化为数据分布。与掩码模型不同,其训练损失考虑了每个去噪步骤中所有序列位置的预测,将生成范式从补全转变为优化,并将采样步数与序列长度解耦。对于从头生成,InVirtuoGen 实现了比以往基于片段的模型更强的质量-多样性 Pareto 前沿,并在片段约束任务上表现出极具竞争力的性能。对于属性和先导化合物优化,我们提出了一种混合方案,将遗传算法与适应离散流的近端属性优化微调策略相结合。我们的方法在 Practical Molecular Optimization 基准上确立了新的技术水平,以跨任务的前 10 AUC 衡量,并在先导化合物优化中产生了比以往基线更高的对接得分。因此,InVirtuoGen 为药物发现建立了一个通用的生成基础,涵盖了从早期苗头化合物发现到多目标先导化合物优化的全过程。我们通过发布预训练检查点和代码来进一步推动开放科学,使我们的结果完全可复现。
引用
@article{arxiv.2509.26405,
title = {Refine Drugs, Don't Complete Them: Uniform-Source Discrete Flows for Fragment-Based Drug Discovery},
author = {Benno Kaech and Luis Wyss and Karsten Borgwardt and Gianvito Grasso},
journal= {arXiv preprint arXiv:2509.26405},
year = {2025}
}