中文

通过直接偏好优化和课程学习实现新颖分子设计

机器学习 2025-04-03 v1 化学物理 生物大分子

摘要

新颖分子设计在药物发现和材料科学中具有广泛应用前景。庞大的化学空间使得直接的分子搜索在计算上不可行,而传统的实验筛选则既耗时又费力。因此,高效的分子生成与筛选方法对于加速药物发现和降低成本至关重要。虽然强化学习(RL)已被应用于通过奖励机制优化分子属性,但其实际效用受限于训练效率、收敛性和稳定性等问题。为此,我们采用自然语言处理中的直接偏好优化(Direct Preference Optimization, DPO)方法,该方法利用基于分子评分的样本对,最大化高质量分子与低质量分子之间的可能性差异,有效引导模型 toward 更好的化合物。此外,融入课程学习进一步提升了训练效率并加速了收敛。在GuacaMol基准测试上的系统评估结果表明,该方法取得了优异的成绩。例如,该方法在Perindopril MPO任务上取得0.883的分数,相较于竞争模型提升了6%。此外,后续的靶点蛋白结合实验确认了其实际应用效效。这一结果表明,DPO在分子设计任务中具有巨大的潜力,同时证明其作为一种稳健且高效的数据驱动药物发现解决方案的有效性。

关键词

引用

@article{arxiv.2504.01389,
  title  = {De Novo Molecular Design Enabled by Direct Preference Optimization and Curriculum Learning},
  author = {Junyu Hou},
  journal= {arXiv preprint arXiv:2504.01389},
  year   = {2025}
}