用稀疏先验编码领域信息以推断可解释潜变量
机器学习
2022-04-12 v2 机器学习
摘要
潜变量模型是强有力的统计工具,可通过从可观测高维数据推断未观测隐藏状态来揭示患者或细胞间的相关变异。然而,当前方法的一个主要缺陷是难以学习稀疏且可解释的隐藏状态。此外,在数据的潜结构部分知识易得的情形下,将先验信息以统计上合理的方式整合进当前方法颇具挑战。为解决这些问题,我们提出 spex-LVM,一种带有稀疏先验的因子化潜变量模型,以鼓励推断由领域相关信息驱动的可解释因子。spex-LVM 利用已有的精选生物医学通路知识,自动将注释属性分配给潜因子,从而产生契合相应关注领域的可解释结果。在模拟与真实单细胞 RNA-seq 数据集上的评估表明,我们的模型以固有可解释方式稳健识别相关结构,区分技术噪声与生物医学变异来源,并提供已有通路注释的数据集特定适配。实现见 https://github.com/MLO-lab/spexlvm。
引用
@article{arxiv.2107.03730,
title = {Encoding Domain Information with Sparse Priors for Inferring Explainable Latent Variables},
author = {Arber Qoku and Florian Buettner},
journal= {arXiv preprint arXiv:2107.03730},
year = {2022}
}
备注
7 pages, 9 figures, Joint KDD 2021 Health Day and 2021 KDD Workshop on Applied Data Science for Healthcare