NaNa 与 MiGu:增强图神经网络中蛋白质分类的语义数据增强技术
定量方法
2024-03-27 v2 人工智能
机器学习
摘要
蛋白质分类任务在药物发现中至关重要。现实世界中的蛋白质结构是动态的,这决定了蛋白质的性质。然而,现有的机器学习方法,如 ProNet (Wang et al., 2022a),仅能获取有限的构象特征和蛋白质侧链特征,导致其预测中的蛋白质结构不切实际且蛋白质类别不准确。在本文中,我们提出了新颖的语义数据增强方法:新节点属性增强(NaNa)和分子相互作用与几何升级(MiGu),以将主链化学和侧链生物物理信息纳入蛋白质分类任务和共嵌入残差学习框架中。具体而言,我们利用蛋白质的分子生物物理、二级结构、化学键和离子特征来促进蛋白质分类任务。此外,我们的语义增强方法和共嵌入残差学习框架可以将 GIN (Xu et al., 2019) 在 EC 和 Fold 数据集 (Bairoch, 2000; Andreeva et al., 2007) 上的性能分别提高 16.41% 和 11.33%。我们的代码可在 https://github.com/r08b46009/Code_for_MIGU_NANA/tree/main 获取。
引用
@article{arxiv.2403.14736,
title = {NaNa and MiGu: Semantic Data Augmentation Techniques to Enhance Protein Classification in Graph Neural Networks},
author = {Yi-Shan Lan and Pin-Yu Chen and Tsung-Yi Ho},
journal= {arXiv preprint arXiv:2403.14736},
year = {2024}
}