中文

寻找基因组中的(基因组)针:稀疏驱动的搜索用于识别癌症中相关基因突变

分布式、并行与集群计算 2026-03-18 v1

摘要

癌症通常并非由单一基因突变(即“一击”)引起,而是由在细胞内累积的多次突变组合引起。然而,随着候选突变基因组合数量的增加,枚举多次突变组合的计算成本呈指数级增长,即 20,000 choose h,其中 20,000 是人类基因组中的基因数,h 是突变次数。为解决这一挑战,我们提出一种算法框架,称为修剪深度优先搜索 (P-DFS),利用肿瘤突变数据中的高稀疏性来修剪大量搜索空间。具体而言,P-DFS(本文的主要贡献)——一种利用稀疏性显著减少 Weighted Set Cover 所需遍历的指数级 h-hit 搜索空间的修剪技术——该技术基于深度优先搜索回溯技术,提前修剪不可行的基因子集,而基于加权集合覆盖的模型则系统性地评分和选择最具辨识力的组合。通过将这些想法与优化位运算和高性能计算集群上的可扩展分布式算法相结合,我们的算法能够实现约 90-98% 的访问组合减少,用于 4-hit 情况,约 183 倍的加速优于穷举集合覆盖方法(该方法在算法上是 NP 完全的),在 147,456 条排名数据上进行测量。通过这种方式,我们的方法能够实际处理四次突变甚至更高阶的基因突变,实现速度和资源效率。

关键词

引用

@article{arxiv.2603.16721,
  title  = {Looking for (Genomic) Needles in a Haystack: Sparsity-Driven Search for Identifying Correlated Genetic Mutations in Cancer},
  author = {Ritvik Prabhu and Emil Vatai and Bernard Moussad and Emmanuel Jeannot and Ramu Anandakrishnan and Wu-chun Feng and Mohamed Wahib},
  journal= {arXiv preprint arXiv:2603.16721},
  year   = {2026}
}