从基因组数据中恢复质盘基因组bins:ChloroScan
基因组学
2025-10-14 v1
摘要
基因组解析的基因组学大大推动了原核基因组的发现。但当用于微生物真核生物时,由于核基因组中高比例的内含子和重复区域,这种方法在挖掘和发现新原始虫属谱系方面面临诸多挑战。器官基因组更简单、更小、丰度更高,包含有价值的系统发育信息,却尚未被广泛用于从基因组中识别新原始虫属谱系。本文提出一种新型生物信息学流程“ChloroScan”,用于从基因组中提取真核生物的质盘基因组。该流程集成了深度学习质盘contig分类器用于识别潜在的质盘contig,以及基于精选标记基因数据库引导的自动化binning模块。此外,ChloroScan以不同用户友好格式总结结果,包括每个bin的注释编码序列和蛋白质。我们展示,ChloroScan在模拟基因组上比MetaBAT2恢复更多高质量质盘bin。通过从四个原虫大小分离基因组中恢复16个中等至高质量的基因组装配基因组,说明了ChloroScan的实际用途,其中几个bin显示出较高的系统发育新颖性。
关键词
引用
@article{arxiv.2510.10950,
title = {ChloroScan: Recovering plastid genome bins from metagenomic data},
author = {Yuhao Tong and Vanessa Rossetto Marcelino and Robert Turnbull and Heroen Verbruggen},
journal= {arXiv preprint arXiv:2510.10950},
year = {2025}
}