中文

重访 K-mer 谱型以实现有效且可扩展的基因组表示学习

机器学习 2024-11-05 v1 人工智能 计算工程、金融与科学 基因组学

摘要

获得 DNA 序列的有效表示对于基因组分析至关重要。例如,宏基因组 binning 依赖于基因组表示来聚类来自生物样本的复杂 DNA 片段混合物,以确定其微生物组成。在本文中,我们重新审视了基于 k-mer 的基因组表示,并对其在表示学习中的应用进行了理论分析。基于该分析,我们提出了一种轻量级且可扩展的模型,用于在基因组读取水平上进行宏基因组 binning,仅依赖 DNA 片段的 k-mer 组成。我们将该模型与近期的基因组基础模型进行了比较,结果表明尽管两者在性能上相当,但所提出的模型在可扩展性方面显著更优,而可扩展性是处理真实世界数据集进行宏基因组 binning 的关键方面。

关键词

引用

@article{arxiv.2411.02125,
  title  = {Revisiting K-mer Profile for Effective and Scalable Genome Representation Learning},
  author = {Abdulkadir Celikkanat and Andres R. Masegosa and Thomas D. Nielsen},
  journal= {arXiv preprint arXiv:2411.02125},
  year   = {2024}
}

备注

Accepted to the Thirty-Eighth Annual Conference on Neural Information Processing Systems (NeurIPS 2024)