中文

通过通用软算子和鲁棒强化学习实现离散组合生成

机器学习 2025-10-13 v2

摘要

科学发现中的一个主要瓶颈在于,将指数级庞大的对象集合(如蛋白质或分子)缩小到一小批具有期望属性的有前景候选者。虽然这个过程可以依赖专家知识,但近期的方法利用由代理奖励函数引导的强化学习(RL)来实现这种筛选。通过采用各种形式的熵正则化,这些方法旨在学习能够生成由代理函数高度评价的多样化候选者的采样器。在这项工作中,我们做出了两项主要贡献。首先,我们表明这些方法在大型搜索空间中容易生成过于多样化、次优的候选者。为解决此问题,我们引入了一种新颖的统一算子,它将几种正则化RL算子结合到一个通用框架中,该框架能更好地针对更尖峰的采样分布。其次,我们提供了对此筛选过程的一种新颖、鲁棒的RL视角。正则化可以解释为对代理函数中组合形式不确定性的鲁棒性(即,候选者的真实评估与代理评估不同)。我们的分析引导我们提出一种新颖、易用的算法,命名为轨迹通用mellowmax(TGM):我们表明,在合成任务和真实世界任务中,它都能识别出比基线更高质量、更多样化的候选者。代码:https://github.com/marcojira/tgm。

关键词

引用

@article{arxiv.2506.17007,
  title  = {Discrete Compositional Generation via General Soft Operators and Robust Reinforcement Learning},
  author = {Marco Jiralerspong and Esther Derman and Danilo Vucetic and Nikolay Malkin and Bilun Sun and Tianyu Zhang and Pierre-Luc Bacon and Gauthier Gidel},
  journal= {arXiv preprint arXiv:2506.17007},
  year   = {2025}
}