中文

通过组相对策略优化实现分摊分子优化

机器学习 2026-05-11 v3

摘要

在结构受限的分子优化中,现有方法为每个新的输入结构从零开始重启昂贵的 oracle驱动搜索,随着起始结构数量众多或 oracle成本高昂时扩展性差。虽然通过学习可迁移策略的分摊方法原则上可以消除这一瓶颈,但现有方法在推断时难以针对多样化的结构约束进行泛化。我们提出了 AMORTIX,一种能够原生支持此类约束的分摊图转换模型,能够在单次前向传播中优化分子结构,且在推断时无需调用 oracle。分摊训练的核心挑战之一是优化难度在不同起始结构之间差异巨大。我们指出,在此异质性条件下,标准强化学习方法难以稳定训练,并通过对完成组内共享相同起始结构的奖励进行归一化来解决此问题。我们在结构受限的单目标和多目标酶抑制剂设计,以及少数样本制剂案例研究中进行评估。AMORTIX 在以目标为导向的骨架装饰任务中超越了所有分摊和实例优化基线方法,并在 PMO 基准测试中排名第一;制剂案例研究进一步展示了将已学习的修改规则迁移到未见过的药物结构的能力。代码已公开 https://github.com/Hash-hh/AMORTIX/。

关键词

引用

@article{arxiv.2602.12162,
  title  = {Amortized Molecular Optimization via Group Relative Policy Optimization},
  author = {Muhammad bin Javaid and Hasham Hussain and Ashima Khanna and Berke Kisin and Jonathan Pirnay and Alexander Mitsos and Dominik G. Grimm and Martin Grohe},
  journal= {arXiv preprint arXiv:2602.12162},
  year   = {2026}
}