用于预测生物网络中未观测节点特征的图特征自编码器
定量方法
2020-12-24 v2 机器学习
机器学习
摘要
动机:分子相互作用网络将复杂的生物学过程概括为图,其结构在多个尺度上提供了生物功能的信息。同时,组学技术测量跨个体或实验条件的基因、蛋白质或代谢物的变异或活性。整合生物网络和组学数据的互补观点是生物信息学中的一项重要任务,但现有方法将网络视为离散结构,本质上难以与连续的节点特征或活性度量相整合。图神经网络将图节点映射到低维向量空间表示,并可被训练以同时保留局部图结构和节点特征之间的相似性。结果:我们使用图神经网络研究了大肠杆菌和小鼠中的转录、蛋白质-蛋白质和遗传相互作用网络的表示。我们发现此类表示解释了基因表达数据中很大比例的变异,并且使用基因表达数据作为节点特征改善了从嵌入中对图的重建。我们进一步提出了一种新的端到端图特征自编码器,该自编码器在特征重建任务上进行训练,并表明在预测未观测节点特征方面,它优于在图重建任务上进行训练然后再学习预测节点特征的自编码器。当应用于单细胞 RNAseq 数据中插补缺失数据的问题时,我们的图特征自编码器优于不使用蛋白质相互作用信息的 state-of-the-art 插补方法,这显示了使用图表示学习整合生物网络和组学数据的益处。
引用
@article{arxiv.2005.03961,
title = {A Graph Feature Auto-Encoder for the Prediction of Unobserved Node Features on Biological Networks},
author = {Ramin Hasibi and Tom Michoel},
journal= {arXiv preprint arXiv:2005.03961},
year = {2020}
}