KHAN之环:具有错误发现率控制的统一图特征选择
统计理论
2024-03-20 v1 定量方法
应用统计
统计方法学
统计理论
摘要
图模型在生物学、化学、社会学、神经科学等领域有众多应用。尽管在图估计方面已取得实质性进展,但如何选择显著的图信号并进行不确定性评估,尤其是那些与拓扑结构相关的图特征,包括环(即wreaths)、团、枢纽等,在很大程度上仍未得到探索。这些特征在蛋白质亚结构分析、药物分子设计和脑网络连接分析中起着至关重要的作用。为填补这一空白,我们为一般高维图模型提出了一种新的推断框架,以在控制错误发现率的情况下选择图特征。我们的方法基于构成感兴趣拓扑特征的单边p值的最大值,因此能够检测弱信号。此外,我们引入了K维持续同调自适应选择(KHAN)算法,以在连续过滤水平上统一控制错误发现率,选择K维内的所有同调特征。KHAN方法应用一种新颖的离散Gram-Schmidt算法,从同调群中选择统计显著的生成元。我们将该结构筛选方法应用于识别SARS-CoV-2刺突蛋白在与ACE2受体结合过程中的重要残基。我们通过网络持续同调中的p值加权过滤水平,对刺突蛋白所有结构域在闭合、部分开放和开放状态下的残基进行评分,并识别出对蛋白质构象变化至关重要、因而可能成为抑制靶点的残基。
引用
@article{arxiv.2403.12284,
title = {The Wreaths of KHAN: Uniform Graph Feature Selection with False Discovery Rate Control},
author = {Jiajun Liang and Yue Liu and Doudou Zhou and Sinian Zhang and Junwei Lu},
journal= {arXiv preprint arXiv:2403.12284},
year = {2024}
}