中文

一种新颖且计算易处理的算法可在大矩阵中标记出与其他列或依变量以任何方式关联的每一列,当各列像染色体中突变那样连锁时功效大幅提高

统计方法学 2022-02-22 v1

摘要

在大数据矩阵DM中穷举扫描与依变量DV关联的独立变量IV子集,仅在1-IV和2-IV效应下计算可行。我提出一种高度计算易处理的参与关联得分(PAS),它能在含标记物的DM中标记出每一个与其他标记物强关联的列。PAS不检验任何列子集,其计算代价随DM列数线性增长,即便在百万列的DM中仍合理。PAS利用DM行中标记物的关联如何在行对比较的匹配关联中体现。对于每一个在待测列处有匹配的此类比较,PAS通过修改该比较的总匹配数(每个DM计一次)来计算其他匹配,从而产生一个被待测列关联扰动的条件匹配分布。同样易处理的是dvPAS,它通过置换DV中的标记物来标记与DV关联的IV。P值由置换获得并经Sidak多重检验校正,绕开了模型选择。模拟表明:i)PAS与dvPAS在零DM中生成均匀-(0,1)-分布的I型错误;ii)分别以穷举评估量级的功效和均匀-(0,1)-分布或可直接调至如此的假阳性,检测出随机遇到的显著n列关联二元与三元模型及与二元DV的n-IV关联。检测双向DV关联的100标记物以上连续区的功效在非参数意义下达到极致,但检测纯n列关联与纯n-IV DV关联的功效随n增大而指数下降。在三元对比二元DM中功效约翻倍,且当存在如染色体中突变间的背景关联时功效大幅提升,尤其在三元DM中dvPAS对此类背景的过滤最为有效。

关键词

引用

@article{arxiv.2202.09958,
  title  = {A novel, computationally tractable algorithm flags in big matrices every column associated in any way with others or a dependent variable, with much higher power when columns are linked like mutations in chromosomes},
  author = {Marcos A. Antezana and Carlos A. Machado},
  journal= {arXiv preprint arXiv:2202.09958},
  year   = {2022}
}