中文

面向基因集集合的冗余感知无监督排序

定量方法 2023-08-01 v1 计算机科学与博弈论 机器学习

摘要

基因集的生物学功能被用于将其分组为集合。这些集合通常具有高维、重叠和冗余的家族特征,从而妨碍对其内容的直接解释与研究。生物信息学寻求降低其维度或提升其可解释性的方案。一种可能的方法是将重叠的基因集合聚合成更大的通路,但修改后的生物学通路很难在生物学上得到合理解释。我们提出使用重要性分数从集合覆盖的视角对集合中的通路进行排序以研究上下文。所提出的基于Shapley值的分数考虑了家族中单例的分布与集合的大小;此外,一种技巧使我们能够规避Shapley值计算通常具有的指数级复杂度。最后,我们应对在所得排序中纳入冗余感知的挑战,其中在我们的情形下,若集合表现出显著交集则它们是冗余的。这些排序可用于降低基因集集合的维度,使其呈现更低冗余性且仍对基因具有高覆盖度。我们进一步研究了我们的筛选对基因集富集分析的影响。所提方法在生物信息学中展现出提升基因集集合可解释性的实用价值,并向在Shapley值计算中纳入冗余迈进了一步。

关键词

引用

@article{arxiv.2307.16182,
  title  = {Redundancy-aware unsupervised rankings for collections of gene sets},
  author = {Chiara Balestra and Carlo Maj and Emmanuel Müller and Andreas Mayr},
  journal= {arXiv preprint arXiv:2307.16182},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2207.12184