中文

基于PropEn的隐式引导设计:匹配数据以跟随梯度

机器学习 2024-05-29 v1 机器学习

摘要

在多个科学领域中,生成新模型或优化现有模型以满足特定标准至关重要。传统的机器学习框架用于引导设计使用生成模型和鉴别模型(判别器),需要大量数据。然而,现实世界的科学应用往往数据有限且景观复杂,使得数据驱动的模型效率低下或难以实现。我们提出了一种新框架PropEn,灵感来自“匹配”方法,使引导过程隐式化,无需训练判别器。通过将每个样本与具有更好属性值的相似样本进行匹配,我们创建了一个更大的训练数据集,本质上指示了改进的方向。匹配方法结合编码器-解码器架构,形成一种针对属性增强的通用生成框架。我们展示,使用匹配数据集训练可近似于感兴趣属性的梯度,同时保持在数据分布内,从而实现高效的设计优化。在玩具问题和科学应用(如治疗性蛋白设计和机翼优化)的广泛评估中,证明了PropEn相对于常见基线方法的优势。值得注意的是,蛋白设计结果经实验室实验验证,确认了该方法的竞争力和有效性。

关键词

引用

@article{arxiv.2405.18075,
  title  = {Implicitly Guided Design with PropEn: Match your Data to Follow the Gradient},
  author = {Nataša Tagasovska and Vladimir Gligorijević and Kyunghyun Cho and Andreas Loukas},
  journal= {arXiv preprint arXiv:2405.18075},
  year   = {2024}
}