LaCoGSEA:通过潜在相关性进行通路分析的无监督深度学习方法
机器学习
2026-01-28 v2 基因组学
摘要
动机:通路富集分析被广泛用于解释基因表达数据。标准方法(如 GSEA)依赖于预定义的表型标签和成对比较,这限制了它们在无监督环境中的适用性。现有的无监督扩展(包括单样本方法)提供了通路层面的总结,但主要捕获线性关系,且未明确对基因-通路关联进行建模。最近,深度学习模型已被探索用于捕获非线性转录组结构。然而,对其解释通常依赖于为特征级归因设计的通用可解释 AI (XAI) 技术。由于这些方法并非为无监督转录组分析中的通路级解释而设计,它们在此环境中的有效性仍然有限。结果:为了弥合这一差距,我们引入了 LaCoGSEA(Latent Correlation GSEA),这是一个将深度表示学习与稳健的通路统计相结合的无监督框架。LaCoGSEA 采用自编码器捕获非线性流形,并提出全局基因-潜在相关性度量作为差异表达的代理,在无先验标签的情况下生成密集的基因排序。我们证明 LaCoGSEA 具有三个关键优势:(i) 与现有的无监督基线相比,它在区分癌症亚型方面实现了改进的聚类性能;(ii) 与线性降维和基于梯度的 XAI 方法相比,它在更高排序处恢复了更广泛的具有生物学意义的通路;(iii) 它在不同的实验方案和数据集大小下保持高稳健性和一致性。总体而言,LaCoGSEA 在无监督通路富集分析中提供了 SOTA 的性能。可用性与实现:https://github.com/willyzzz/LaCoGSEA
引用
@article{arxiv.2601.18604,
title = {LaCoGSEA: Unsupervised deep learning for pathway analysis via latent correlation},
author = {Zhiwei Zheng and Kevin Bryson},
journal= {arXiv preprint arXiv:2601.18604},
year = {2026}
}