中文

废水基因组测序中变异检测的对比深度学习

机器学习 2025-12-04 v1 基因组学

摘要

基于废水的基因组监测已成为人群层面病毒监测的有力工具,能够提供整个社区中循环病毒变异的全面见解。然而,该方法面临显著的计算挑战,源于高通量测序噪声、低病毒覆盖度、片段化读段以及变异标注的完全缺失。传统的基于参考的变异调用流程难以处理新突变,且需要大量计算资源。我们提出了一套基于向量量化变分自编码器(VQ-VAE)的无监督病毒变异检测完整框架,该框架从k-mer分词序列中学习基因组模式的离散代码本,无需参考基因组或变异标注。我们的方法在基础VQ-VAE架构上扩展了掩码重建预训练以增强对缺失数据的鲁棒性,以及对比学习以获得高判别性嵌入。在约100,000条SARS-CoV-2废水测序数据上评估后,我们的VQ-VAE实现了99.52%的平均token级准确率和56.33%的精确序列匹配率,同时保持了19.73%的代码本利用率(512个代码中有101个活跃),展示了高效的离散表示学习。通过不同投影维度的对比微调带来了显著的聚类改进:64维嵌入实现了+35%的轮廓系数提升(从0.31到0.42),而128维嵌入实现了+42%的提升(从0.31到0.44),清晰展示了嵌入维度对变异判别能力的影响。我们的无参考框架为基因组监测提供了可扩展、可解释的方法,对公共卫生监测具有直接应用价值。

关键词

引用

@article{arxiv.2512.03158,
  title  = {Contrastive Deep Learning for Variant Detection in Wastewater Genomic Sequencing},
  author = {Adele Chinda and Richmond Azumah and Hemanth Demakethepalli Venkateswara},
  journal= {arXiv preprint arXiv:2512.03158},
  year   = {2025}
}

备注

13 pages, 4 figures