中文

双视图数据中交叉相关特征组的发现

统计方法学 2024-05-15 v4 机器学习 机器学习

摘要

在许多科学应用中,会出现从同一组样本上测得两种(或更多)类型数据的数据集。此类数据探索性分析中的一个常见问题是识别不同数据类型中强关联的特征组。双模块是一对(A,B),分别来自两种数据类型的特征集,使得 A 中特征与 B 中特征的总体交叉相关性很大。若 A 恰为与 B 中特征具有显著总体相关性的特征集,反之亦然,则双模块(A,B)是稳定的。本文提出一种基于迭代检验的双模块搜索流程(BSP)以识别稳定双模块。与现有的检测交叉相关特征的方法相比,BSP 在信号充足时恢复真实双模块的表现最佳,同时限制了错误发现。此外,我们将 BSP 应用于利用 GTEx 联盟数据进行的表达数量性状位点(eQTL)分析问题。BSP 识别出了数千个 SNP-基因双模块。尽管所发现双模块中出现的许多单个 SNP-基因对已被标准 eQTL 方法识别,但这些发现的双模块揭示了看似具有生物学意义且值得进一步科学研究的基因组子网络。

关键词

引用

@article{arxiv.2009.05079,
  title  = {Finding Groups of Cross-Correlated Features in Bi-View Data},
  author = {Miheer Dewaskar and John Palowitch and Mark He and Michael I. Love and Andrew B. Nobel},
  journal= {arXiv preprint arXiv:2009.05079},
  year   = {2024}
}

备注

30 pages, 5 figures. R package: https://github.com/miheerdew/cbce