数据挖掘公共基因组库:利用脱靶读段拓展微生物病原�基因资源
定量方法
2025-05-16 v1
摘要
随着测序技术日益便宜且基因组数据库持续扩张,复用公开测序数据已成为研究微生物病原�的强大策略。事实上,针对特定生物体进行的原始测序读段常包含来自相关微生物群的读段。本综述探讨了此类脱靶读段如何被检测并用于研究微生物病原�。我们呈现将基因组数据挖掘作为从 petabyte 级别的数据库中识别相关测序数据的一种方法,强调最近的方法学进步,使其能够高效查询数据库。随后简要概述旨在检索相关数据及其关联元数据的技术,并提供常见下游分析管道的概览。我们讨论了这些方法如何(i)扩充了微生物病原�的已知遗传多样性,(ii)深化了对其时空分布的理解,以及(iii)揭示了涉及微生物病原�的先前未被识别的生态相互作用。然而,这些分析常常依赖于伴随元数据的完整性和准确性,而这些元数据高度不一致。我们详细描述了常见的陷阱,包括数据污染和元数据误标注,并提出了结果解读的策略。最终,尽管数据挖掘无法取代专门研究,但其作为微生物病原�研究的必不可少且补充性工具。更广泛的实用性取决于数据标准化的改进以及生态系统中系统性的基因组监测。
引用
@article{arxiv.2505.10017,
title = {Data mining of public genomic repositories: harnessing off-target reads to expand microbial pathogen genomic resources},
author = {Damien Richard and Nils Poulicard},
journal= {arXiv preprint arXiv:2505.10017},
year = {2025}
}