中文

基于外推伪标签匹配的可靠OOD虚拟筛选

机器学习 2026-03-25 v5 人工智能

摘要

机器学习模型越来越多地被用于药物发现中的虚拟筛选,其目标是识别新颖、化学结构多样的骨架,同时最小化实验成本。这带来了一个根本性挑战:最有价值的发现位于训练数据之外的分布外(OOD)区域,然而机器学习模型在分布偏移下性能往往会下降。标准的创新性拒绝策略确保了训练域内的可靠性,但通过精确拒绝最值得发现的新颖骨架而限制了发现。此外,实验预算只允许测试少数被提名的候选物,这要求模型能够产生可靠的置信度估计。我们提出了EXPLOR(用于基于OOD不确定性的拒绝的外推伪标签匹配),这是一个通过潜在空间增强上的外推伪标签来应对这两个挑战的框架,它只需要一个带标签的训练集,且无需访问未标记的测试化合物,这模拟了前瞻性筛选活动的现实条件。通过一个具有新颖的每头匹配损失的多头架构,EXPLOR学会了外推到OOD化学空间,同时产生可靠的置信度估计,在高置信度区域表现尤为强劲,这对于只有排名靠前的候选物才能进入实验验证的虚拟筛选至关重要。我们使用不同的分子嵌入,在化学和表格基准测试中展示了最先进的性能。

关键词

引用

@article{arxiv.2406.01825,
  title  = {Reliable OOD Virtual Screening with Extrapolatory Pseudo-Label Matching},
  author = {Yunni Qu and Bhargav Vaduri and Karthikeya Jatoth and James Wellnitz and Dzung Dinh and Seth Veenbaas and Jonathan Chapman and Alexander Tropsha and Junier Oliva},
  journal= {arXiv preprint arXiv:2406.01825},
  year   = {2026}
}