MS-BioGraphs:序列相似性图数据集
分布式、并行与集群计算
2023-09-01 v1 硬件体系结构
计算工程、金融与科学
离散数学
性能
摘要
高性能计算(尤其是高性能图处理)的进展高度依赖于公开可获取、相关且真实的数据集的可用性。为保障这一进展的延续,我们 (i) 将生成大型序列相似性图作为 HPC 挑战加以研究并优化,且 (ii) 展示该过程在创建 MS-BioGraphs 中的应用——一个新的公开可用真实世界边加权图数据集族,其边多达 万亿条,即比近期发布的最大图大 倍。该最大图通过对 亿条蛋白质序列进行匹配(即全对全相似性比对)创建。MS-BioGraphs 族还包含七个不同大小与方向类型的子图。我们描述了在生成大型图数据集时面临的两个主要挑战及我们的解决方案,即 (i) 为这一多步过程优化数据结构与算法,以及 (ii) WebGraph 并行压缩技术。我们给出了 MS-BioGraphs 结构特征的比较研究。数据集在线发布于 https://blogs.qub.ac.uk/DIPSA/MS-BioGraphs 。
引用
@article{arxiv.2308.16744,
title = {MS-BioGraphs: Sequence Similarity Graph Datasets},
author = {Mohsen Koohi Esfahani and Paolo Boldi and Hans Vandierendonck and Peter Kilpatrick and Sebastiano Vigna},
journal= {arXiv preprint arXiv:2308.16744},
year = {2023}
}