中文

Petabyte Scale Sequence Search Codeathon 对 SRA 上基于序列的搜索规模化努力的贡献

其他定量生物学 2025-05-13 v1

摘要

生物学数据正在通过技术进步和科研活动不断增长。美国国立卫生研究院 (NIH) 的序列读档库 (SRA),由美国生物技术信息中心 (NCBI) 位于美国图书馆医学院 (NLM) 维护,是研究人员用于推动生命所有领域科学发现的快速增长的公共数据库。此数据量的增加为推动科学发现带来了巨大希望,也带来了科学社区需要应对的新挑战。随着基因组数据集在规模和多样性方面的增长,一系列新的方法和相关软件开发出来,以应对这种增长所带来的挑战。这些方法论的进展对于充分利用下一代测序 (NGS) 技术的力量至关重要。以为评估 petabyte 规模序列搜索的方法奠定基础,美国能源部 (DOE) 生物环境研究办公室 (BER)、NIH 数据科学策略办公室 (ODSS) 以及 NCBI 于 2021 年 9 月 27 日至 10 月 1 日举办了虚拟 codeathon 'Petabyte Scale Sequence Search: Metagenomics Benchmarking Codeathon',以评估 petabyte 规模序列搜索的新兴解决方案。codeathon 吸引了来自全国实验室、研究机构和大学的专家,旨在 (a) 发展解决大规模宏基因组数据分析挑战的方法 (宏基因组数据约占 SRA 的 20%), (b) 识别从 SRA 全面搜索中受益的潜在应用以及执行搜索所需的工具,以及 (c) 生产社区资源,即公开面向的存储库,包含信息以重建和再现每个团队挑战所解决的问题。

关键词

引用

@article{arxiv.2505.06395,
  title  = {Contributions of the Petabyte Scale Sequence Search Codeathon toward efforts to scale sequence-based searches on SRA},
  author = {Priyanka Ghosh and Kjiersten Fagnan and Ryan Connor and Ravinder Pannu and Travis J. Wheeler and Mihai Pop and C. Titus Brown and Tessa Pierce-Ward and Rob Patro and Jacquelyn S. Michaelis and Thomas L. Madden and Christiam Camacho and Olaitan I. Awe and Arianna I. Krinos and René KM Xavier and Rodrigo Ortega Polo and Jack W. Roddy and Adelaide Rhodes and Alexander Sweeten and Adrian Viehweger and Bariş Ekim and Harihara Subrahmaniam Muralidharan and Amatur Rahman and Vinícius W. Salazar and Andrew Tritt and Thomas Colligan and Katrina Kalantar and Genevieve R. Krause and Taylor Reiter and George Lesica and Artem Babaian and Victor Lin and Sergey Madaminov and Vadim Zalunin and David M. Kristensen and Alexa Salsbury and Daniel P. Rice and J. Rodney Brister},
  journal= {arXiv preprint arXiv:2505.06395},
  year   = {2025}
}