面向推理模型的 de novo 分子生成训练与评估基准——MolRGen
机器学习
2026-05-12 v2 人工智能
摘要
近期基于推理的大型语言模型在具有可验证结果的任务上表现出色,但其在 de novo 分子生成中受限于缺乏无需参考分子即可计算奖励的训练环境。我们引入 MolRGen,一个用于训练和评估推理 LLM 在 de novo 分子生成中的基准和分子验证器。MolRGen 包含约 4,500 个蛋白-口袋靶点, resulting in 50k 多目标优化提示,将 docking 分数与分子属性(如 QED、合成可达性、logP 和理化描述符)相结合。与基于说明符的生成或分子编辑基准不同,MolRGen 在生成时计算奖励,评估者从头提出的分子。我们对通用和化学专业的开源 LLM 进行基准测试,并引入一种多样性感知的 top-k 指标,以衡量模型是否能够生成一组多样化的高分子。最后,我们使用验证器对 128B LLM 进行 GRPO 微调,显示出改进的性能,但以多样性-开发权衡为代价。MolRGen 为研究基于验证器的推理和强化学习在分子设计中的应用提供了一个可扩展的测试平台。
关键词
引用
@article{arxiv.2603.18256,
title = {MolRGen: A Training and Evaluation Setting for De Novo Molecular Generation with Reasonning Models},
author = {Philippe Formont and Maxime Darrin and Ismail Ben Ayed and Pablo Piantanida},
journal= {arXiv preprint arXiv:2603.18256},
year = {2026}
}