中文

基于强化学习对齐的可控多目标分子优化 C-MORAL

机器学习 2026-05-28 v2 人工智能

摘要

大型语言模型 (LLM) 在分子优化方面显示出前景,但将其与选择性和竞争性药物设计约束对齐仍具有挑战性。我们提出 C-MORAL,一个基于强化学习的后训练框架,用于可控的多目标分子优化。C-MORAL 结合基于组的相对优化、针对异构目标的属性得分对齐以及受瓶颈敏感的非线性奖励聚合,以提高跨竞争分子属性的稳定性。在 C-MuMOInstruct 和 S2^2-Bench MolOpt 上的实验表明,C-MORAL 在两个基准测试中均取得最佳性能。在 C-MuMOInstruct 上,C-MORAL 在领域内任务上实现了最佳成功优化率 (SOR) 为 48.9%,在领域外任务上为 39.5%,同时保持了骨架相似性。在 S2^2-Bench MolOpt 上,还在 LogP、MR 和 QED 优化任务中取得了最强结果。这些结果表明,C-MORAL 是一种有效的方法,用于将分子 LLM 与连续且受约束的分子设计目标对齐。我们的代码和模型已公开发布于 https://github.com/Rwigie/C-MORAL。

关键词

引用

@article{arxiv.2604.23061,
  title  = {C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs},
  author = {Rui Gao and Youngseung Jeon and Swastik Roy and Morteza Ziyadi and Xiang 'Anthony' Chen},
  journal= {arXiv preprint arXiv:2604.23061},
  year   = {2026}
}

备注

26 pages, 7 figures