中文

分子基础模型能否识别其未知领域?偏好优化的简单方法

机器学习 2025-10-01 v1 定量方法

摘要

分子基础模型正在快速推进科学发现,但其对分布外(OOD)样本的不可靠性严重限制了其在药物发现和蛋白质设计等高风险领域的应用。一种关键的失效模式是化学幻觉,即模型对未知分子做出高置信度但完全错误的预测。为应对这一挑战,我们提出了分子偏好对齐实例排序(Mole-PAIR),这是一个简单即插即用的模块,可以灵活集成到现有基础模型中,通过经济高效的后训练来提升其在 OOD 数据上的可靠性。具体而言,我们的方法将 OOD 检测问题表述为对分布内(ID)样本与 OOD 样本之间估计的 OOD 亲和力的偏好优化,通过成对学习目标来实现这一目标。我们表明该目标本质上优化了 AUROC,即衡量模型对 ID 和 OOD 样本排序的一致性程度。在五个真实分子数据集上的大量实验表明,我们的方法显著提升了现有分子基础模型的 OOD 检测能力,在尺寸、骨架和检测三种分布偏移下 AUROC 分别提升了高达 45.8%、43.9% 和 24.3%。

关键词

引用

@article{arxiv.2509.25509,
  title  = {Can Molecular Foundation Models Know What They Don't Know? A Simple Remedy with Preference Optimization},
  author = {Langzhou He and Junyou Zhu and Fangxin Wang and Junhua Liu and Haoyan Xu and Yue Zhao and Philip S. Yu and Qitian Wu},
  journal= {arXiv preprint arXiv:2509.25509},
  year   = {2025}
}