中文

基于RNA-seq数据的图神经网络中层化池化与解释性用于肿瘤和组织来源分类

机器学习 2026-01-13 v1 基因组学

摘要

本研究探索了使用图神经网络(GNN)结合层次化池化和多个卷积层进行的癌症分类方法,基于RNA-seq数据。我们将来自The Cancer Genome Atlas(TCGA)的基因表达数据与预计算的STRING蛋白-蛋白相互作用网络相结合,用于组织来源分类并区分正常与肿瘤样本。该模型采用切比雪夫图卷积(K=2)和加权池化层,将基因簇聚合为跨多个细化水平的'超节点'。这种方法在保持有意义相互作用的同时实现了维度降低。应用敏感度方法对模型进行解释,通过识别关键基因和与癌症相关的生物学过程来实现解释。我们的发现表明,增加卷积和池化层的数量并未提升分类性能。 achieved the highest F1-macro score (0.978) with a single pooling layer。然而,增加更多层数导致了过平滑并造成性能下降。然而,该模型通过梯度方法证明具有高度可解释性,识别出已知癌症相关基因并突出了富集的生物学过程,其层次化结构可用于开发新的可解释架构。总体而言,尽管更深的GNN架构未能提升性能,但层次化池化结构提供了有价值的肿瘤生物学见解,使GNNs成为癌症生物标志物发现和解释的有前景的工具。

关键词

引用

@article{arxiv.2601.06381,
  title  = {Hierarchical Pooling and Explainability in Graph Neural Networks for Tumor and Tissue-of-Origin Classification Using RNA-seq Data},
  author = {Thomas Vaitses Fontanari and Mariana Recamonde-Mendoza},
  journal= {arXiv preprint arXiv:2601.06381},
  year   = {2026}
}