基于上下文的图结构因果推断用于少样本分子性质预测
机器学习
2026-01-19 v1 人工智能
摘要
分子性质预测正成为图学习在 Web 服务中(如在线蛋白质结构预测和药物发现)的主要应用之一。一个关键挑战在于稀疏场景,即仅为预测未见性质的分子提供少量标记样本。最近的几项研究使用基于情境的学习来捕获分子与性质之间的关系,但它们面临两个局限性:(1) 利用与性质因果关联的功能基团的先验知识,(2) 直接识别与性质密切相关的关键次结构。我们提出了 CaMol—a 基于上下文的图结构因果推断框架,以解决这些挑战。该框架采用因果推断视角,假设每个分子由决定特定性质的潜在因果结构组成。首先,我们引入情境图,通过链接功能基团、分子和性质来编码化学知识,从而引导发现因果次结构。其次,我们提出一种可学习的原子遮蔽策略,用于从混杂次结构中解耦因果次结构。最后,我们引入分布干扰器,通过结合因果次结构与化学实践中建立的混杂因子来应用背门调整,使因果效应与真实化学变异性相分离。在多样化分子数据集上的实验表明,CaMol 在稀疏任务上实现了卓越的准确率和样本效率,显示出对未见性质的广泛可推广性。此外,发现的因果次结构与功能基团的化学知识高度一致,支持了模型的可解释性。
引用
@article{arxiv.2601.11135,
title = {Context-aware Graph Causality Inference for Few-Shot Molecular Property Prediction},
author = {Van Thuy Hoang and O-Joun Lee},
journal= {arXiv preprint arXiv:2601.11135},
year = {2026}
}
备注
15 pages