中文

MolMem:用于样本高效分子优化的记忆增强型智能体强化学习

机器学习 2026-04-15 v1 人工智能 计算与语言

摘要

在药物发现中,分子优化旨在迭代细化前驱化合物,以提高分子属性的同时保持其结构相似性。然而,每一次 oracle 评估都昂贵昂贵,使得在有限 oracle 预算下,样本效率是现有方法的关键挑战。试错方法需要大量 oracle 调用,而依赖外部知识的方法则倾向于重复熟悉的模板,难以应对具有挑战性的目标。一个关键缺失环节是能够为决策提供 grounding 并为未来优化提供可重用洞见的长期记忆。为此,我们提出 MolMem(分子优化与记忆,Molecular optimization with Mem)——一个具有双记忆系统的多回合智能体强化学习框架。具体而言,MolMem 使用静态范例记忆(Static Exemplar Memory)检索相关范例以进行冷启动 grounding,利用演化技能记忆(Evolving Skill Memory)将成功的轨迹蒸馏为可重用的策略。基于这一记忆增强的表述,我们通过稠密的逐步奖励训练策略,将高成本的 rollout 转化为改善未来优化的长期知识。大量实验表明,MolMem 在单属性任务上实现 90% 的成功率(超越最佳基线 1.5 倍),在多属性任务上实现 52% 的成功率,仅需 500 次 oracle 调用。我们的代码已公开于 https://github.com/REAL-Lab-NU/MolMem。

关键词

引用

@article{arxiv.2604.12237,
  title  = {MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization},
  author = {Ziqing Wang and Yibo Wen and Abhishek Pandy and Han Liu and Kaize Ding},
  journal= {arXiv preprint arXiv:2604.12237},
  year   = {2026}
}