中文

缓解基于分数的分子构象生成中的暴露偏差

机器学习 2024-09-24 v1 人工智能 生物大分子

摘要

分子构象生成在计算化学领域是一个重大挑战。近期,扩散概率模型和基于分数的生成模型因能够生成远超传统基于物理方法的准确构象而得到有效应用。然而,训练与推理之间的差异引发了一个被称为暴露偏差的关键问题。尽管该问题在 DPMs 中已被广泛研究,但 SGMs 中暴露偏差的存在及其有效测量仍未解决,这阻碍了包括以 ConfGF 和 Torsional Diffusion 为代表的 SGMs 补偿方法的使用。在本工作中,我们首先提出了一种用于测量分子构象生成 SGMs 中暴露偏差的方法,该方法证实了这些模型中暴露偏差的显著存在并测量了其数值。我们设计了一种新的补偿算法输入扰动,该方法改编自最初仅为 DPMs 设计的方法。实验结果表明,通过引入 IP,基于 SGM 的分子构象模型可以显著提高生成构象的准确性和多样性。特别是通过使用 IP 增强的 Torsional Diffusion 模型,我们在 GEOM-Drugs 数据集上达到了新的 SOTA 性能,并在 GEOM-QM9 上表现相当。我们在 https://github.com/jia-975/torsionalDiff-ip 公开了代码。

关键词

引用

@article{arxiv.2409.14014,
  title  = {Mitigating Exposure Bias in Score-Based Generation of Molecular Conformations},
  author = {Sijia Wang and Chen Wang and Zhenhao Zhao and Jiqiang Zhang and Weiran Cai},
  journal= {arXiv preprint arXiv:2409.14014},
  year   = {2024}
}

备注

SMC 2024