基于堆叠集成的多模态致突变性预测模型——运用图注意力网络
机器学习
2024-09-06 v3
摘要
致突变性因其与基因突变相关,可导致多种负面后果,包括癌症发展。因此,及早识别药物开发过程中潜在的致突变化合物至关重要,以防止不安全候选物的进入并降低开发成本。虽然计算技术,特别是机器学习模型在此一领域日益普及,但它们往往仅依赖单一模态数据。本文提出一种新型的基于堆叠集成的致突变性预测模型,融合多种模态数据,包括简化分子输入线系统 (SMILES) 和分子图。其中,SMILES 用于捕获分子的亚结构、几何和物理化学信息,而分子图则通过图注意力网络 (GAT) 提取拓扑信息。我们的模型采用机器学习分类器的堆叠集成来综合运用上述多特征。我们运用可解释人工智能 (XAI) 技术 SHAP (Shapley 增量解释) 来确定每个分类器的重要性以及预测中最相关的特征。实验结果表明,我们的方法在两个标准数据集上超越了当前的最佳方法,在各种指标上均取得优异成绩。尤其,在汉森基准数据集上实现了 95.21% 的曲线下面积,证明了本方法在预测致突变性方面的有效性。我们认为本研究将吸引临床科学家和计算生物学家在转化医学研究中的关注者。
引用
@article{arxiv.2409.01731,
title = {Stacked ensemble\-based mutagenicity prediction model using multiple modalities with graph attention network},
author = {Tanya Liyaqat and Tanvir Ahmad and Mohammad Kashif and Chandni Saxena},
journal= {arXiv preprint arXiv:2409.01731},
year = {2024}
}
备注
Submitted to a journal