极端规模的蛋白质全对全相似性搜索
分布式、并行与集群计算
2023-03-06 v1 性能
基因组学
摘要
相似性搜索是不断增长的蛋白质数据集上定期执行的最基本计算之一。可扩展性对于揭示极大规模下出现的新现象至关重要。我们释放 Summit 系统上超过 20,000 个 GPU 的算力,在包含 4.05 亿个蛋白质的最大公开可用数据集之一上执行全对全蛋白质相似性搜索,耗时不到 3.5 小时,将许多用例的求解时间从数周缩短。蛋白质序列长度的可变性以及两两比较空间的稀疏性,使该问题在分布式内存中极具挑战性。由于需要构建并维护一个持有指向所有其他序列索引的数据结构,该应用具有巨大的内存占用,难以扩展问题规模。我们通过创新的基于矩阵的分块技术克服了这一内存限制,且不引入额外的负载不均衡。
引用
@article{arxiv.2303.01845,
title = {Extreme-scale many-against-many protein similarity search},
author = {Oguz Selvitopi and Saliya Ekanayake and Giulia Guidi and Muaaz G. Awan and Georgios A. Pavlopoulos and Ariful Azad and Nikos Kyrpides and Leonid Oliker and Katherine Yelick and Aydın Buluç},
journal= {arXiv preprint arXiv:2303.01845},
year = {2023}
}
备注
2022 ACM Gordon Bell Prize Finalist