中文

AdaptMol:从序列字符串到拓扑结构的自适应融合用于少样本药物发现

机器学习 2025-05-20 v1 人工智能 分子网络

摘要

准确的分子性质预测 (MPP) 是现代药物开发中的关键步骤。然而,实验验证数据的稀缺性构成了人工智能驱动研究范式的重大挑战。在少样本学习场景下,分子表征的质量直接决定了模型性能的理论上限。我们提出了 AdaptMol,一个集成自适应多模态融合的原型网络。该框架采用双层注意力机制动态整合来自两种模态:SMILES 序列和分子图,从而获得分子表示。(1) 在局部层面,从分子图中提取结构特征如原子相互作用和次结构,强调细粒度的拓扑信息;(2) 在全局层面,SMILES 序列提供分子的整体表示。为验证双模态自适应融合的必要性,我们提出了一种基于识别分子活性次结构的可解释方法,表明双模态自适应融合能够高效地表示分子。在三个常用基准数据集上进行 5-shot 和 10-shot 设置下的广泛实验表明,AdaptMol 在大多数情况下实现了领先的性能。该方法从提取原理中引导了两种模态的融合,凸显了两种模态的重要性。

关键词

引用

@article{arxiv.2505.11878,
  title  = {AdaptMol: Adaptive Fusion from Sequence String to Topological Structure for Few-shot Drug Discovery},
  author = {Yifan Dai and Xuanbai Ren and Tengfei Ma and Qipeng Yan and Yiping Liu and Yuansheng Liu and Xiangxiang Zeng},
  journal= {arXiv preprint arXiv:2505.11878},
  year   = {2025}
}

备注

15 pages, 6 figures