BLEND:基因组分析中查找模糊种子匹配的一种快速、内存高效且准确的机制
基因组学
2023-05-24 v7
摘要
生成称为种子的短子序列的哈希值,可通过一次查找其哈希值来快速识别基因组序列之间的相似性。然而,这些哈希值仅能用于查找精确匹配的种子,因为传统哈希方法为不同种子(包括高度相似的种子)分配不同的哈希值。仅查找精确匹配的种子会导致 1)增加昂贵的序列比对的使用,或 2)灵敏度受限。我们提出 BLEND,这是首个能以一次哈希值查找同时识别精确匹配和高度相似种子(称为模糊种子匹配)的高效准确机制。BLEND 1)利用一种称为 SimHash 的技术,可为相似集合生成相同哈希值;2)提供了将种子作为集合与 SimHash 技术配合使用的恰当机制,以高效查找模糊种子匹配。我们展示了 BLEND 用于读重叠和读映射时的优势。对于读重叠,BLEND 比最先进工具 minimap2 快 2.4x - 83.9x(平均 19.3x),内存占用低 0.9x - 14.1x(平均 3.8x),并找到更高质量的重叠从而得出准确的从头组装。对于读映射,BLEND 比 minimap2 快 0.8x - 4.1x(平均 1.7x)。源代码可在 https://github.com/CMU-SAFARI/BLEND 获取。
引用
@article{arxiv.2112.08687,
title = {BLEND: A Fast, Memory-Efficient, and Accurate Mechanism to Find Fuzzy Seed Matches in Genome Analysis},
author = {Can Firtina and Jisung Park and Mohammed Alser and Jeremie S. Kim and Damla Senol Cali and Taha Shahroodi and Nika Mansouri Ghiasi and Gagandeep Singh and Konstantinos Kanellopoulos and Can Alkan and Onur Mutlu},
journal= {arXiv preprint arXiv:2112.08687},
year = {2023}
}
备注
Published in NARGAB