中文

TriSig:三簇模式的统计显著性评估

机器学习 2023-06-13 v2 统计方法学

摘要

张量数据分析使研究者能够揭示仅凭矩阵数据无法获得的新型模式与关系。从这些模式中推断出的信息为疾病进展、生物生产过程、天气波动和群体动态提供了有价值的见解。然而,虚假和冗余模式阻碍了这一过程。本工作旨在提出一个统计框架,用于评估张量数据中模式偏离零期望的概率,扩展了用于评估矩阵数据中模式统计显著性的成熟原理。在变量依赖性、时间依赖性与错位,以及 Benjamini-Hochberg 程序下的 p 值校正背景下,对假阳性发现的二项检验进行了全面讨论。在生化和生物技术领域的不同真实案例研究中应用最先进的三簇算法所收集的结果,证实了所提统计框架的有效性,同时揭示了一些三簇搜索的脆弱性。所提出的评估可整合到现有三簇算法中,以减轻假阳性/虚假发现并进一步剪枝搜索空间,降低其计算复杂度。可用性:代码在 https://github.com/JupitersMight/TriSig 下根据 MIT 许可证免费提供。

关键词

引用

@article{arxiv.2306.00643,
  title  = {TriSig: Assessing the statistical significance of triclusters},
  author = {Leonardo Alexandre and Rafael S. Costa and Rui Henriques},
  journal= {arXiv preprint arXiv:2306.00643},
  year   = {2023}
}