中文

基于 Transformer 从宏基因组数据中准确识别噬菌体

基因组学 2022-08-15 v2

摘要

动机:噬菌体是感染细菌的病毒。作为微生物群落中的关键角色,它们可通过感染细菌宿主并介导基因转移来调节微生物组的组成与功能。近年来,能够对各种微生物组的所有遗传物质进行测序的宏基因组测序,已成为发现新噬菌体的流行手段。然而,从宏基因组数据中准确且全面地检测噬菌体仍然困难。高多样性/丰度以及有限的参考基因组,给从宏基因组数据中回收噬菌体片段带来了主要挑战。现有的基于比对或基于学习的模型在宏基因组数据上要么召回率低,要么精确率低。结果:在本工作中,我们采用最先进的语言模型 Transformer,对噬菌体重叠群(contig)进行上下文嵌入。通过构建蛋白簇词表,我们可将每个重叠群中的蛋白组成及其位置一并输入 Transformer。Transformer 可利用自注意力机制学习蛋白的组织与关联,并预测测试重叠群的标签。我们在多个难度递增的数据集上严格测试了所开发的工具 PhaMer,包括高质量 RefSeq 基因组、短重叠群、模拟宏基因组数据、模拟宏基因组数据(mock metagenomic data)以及公共 IMG/VR 数据集。所有实验结果均表明 PhaMer 优于当前最先进的工具。在真实宏基因组数据实验中,PhaMer 将噬菌体检测的 F1-score 提高了 27%。

关键词

引用

@article{arxiv.2201.04778,
  title  = {Accurate identification of bacteriophages from metagenomic data using Transformer},
  author = {Jiayu Shang and Xubo Tang and Ruocheng Guo and Yanni Sun},
  journal= {arXiv preprint arXiv:2201.04778},
  year   = {2022}
}

备注

15 phages, 11 figures