可解释分子属性预测:通过语言模型将化学概念与预测对齐
机器学习
2026-01-14 v4 人工智能
摘要
为提供可解释的分子属性预测至关重要,这对于许多科学领域如药物发现和材料科学至关重要。虽然基于 transformer 的语言模型在准确的分子属性预测方面显示出巨大的潜力,但它们既不提供化学上有意义的解释,也不忠实地揭示分子结构-性质关系。在本工作中,我们开发了一个基于语言模型的可解释分子属性预测框架,称为 Lamole,可以提供与化学概念对齐的解释。我们采用字符串形式的分子表示——Group SELFIES 作为输入标记进行预训练和微调 Lamole,因为它提供了化学上有意义的语义。通过解离 Lamole 的信息流,我们提出结合自注意力权重和梯度以更好地量化每个化学上有意义亚结构对模型输出的影响。为使解释更忠实地尊重结构-性关系,我们 then carefully craft a marginal loss to explicitly optimize the explanations to be able to align with the chemists' annotations。我们将流形假设与所述的边际损失桥接,以证明该损失可以将解释与数据流形的切空间对齐,从而导致概念对齐的解释。在六个致突变数据集和一个肝毒性数据集上的实验结果表明,Lamole 能够实现相当的分类准确率,并通过最高达 14.3% 提升解释准确率,成为可解释分子属性预测的领先方法。
引用
@article{arxiv.2405.16041,
title = {Explainable Molecular Property Prediction: Aligning Chemical Concepts with Predictions via Language Models},
author = {Zhenzhong Wang and Zehui Lin and Wanyu Lin and Ming Yang and Minggang Zeng and Kay Chen Tan},
journal= {arXiv preprint arXiv:2405.16041},
year = {2026}
}