中文

TEPI:面向稀缺标签零样本基因组分类的分类学感知嵌入与伪成像

基因组学 2024-01-25 v1 人工智能 机器学习

摘要

一个物种的遗传密码或基因组编码了有价值的进化、生物学和系统发育信息,有助于物种识别、分类学分类以及理解耐药性和毒力等遗传易感性。然而,大量潜在物种在开发通用型全基因组分类工具方面提出了重大挑战。传统的生物信息学工具已取得显著进展,但缺乏可扩展性且计算成本高昂。基于机器学习的框架显示出前景,但必须解决具有长尾分布的大型分类词汇表问题。在本研究中,我们提出通过使用 TEPI(分类学感知嵌入与伪成像)的零样本学习来解决这一问题。我们将每个基因组表示为伪图像,并将它们映射到分类学感知的嵌入空间以进行推理和分类。该嵌入空间捕获了物种的组成和系统发育关系,从而能够在广阔的搜索空间中进行预测。我们使用两种严格的零样本设置评估了 TEPI,并在精选的、大规模的、公开来源的数据上定性地展示了其泛化能力。

关键词

引用

@article{arxiv.2401.13219,
  title  = {TEPI: Taxonomy-aware Embedding and Pseudo-Imaging for Scarcely-labeled Zero-shot Genome Classification},
  author = {Sathyanarayanan Aakur and Vishalini R. Laguduva and Priyadharsini Ramamurthy and Akhilesh Ramachandran},
  journal= {arXiv preprint arXiv:2401.13219},
  year   = {2024}
}

备注

Accepted to IEEE JBHI