快速且可扩展的基因嵌入搜索:FAISS与ScaNN的比较研究
基因组学
2025-07-24 v1 人工智能
机器学习
摘要
DNA测序数据的指数级增长已超越了传统的基于启发式的方法,这些方法难以有效扩展。迫切需要高效的计算方法来支持大规模相似性搜索,这是生物信息学中用于检测基因组和蛋白质组序列间的同源性、功能相似性和新异性的一项基础任务。尽管BLAST等工具已被广泛使用并在许多场景中仍然有效,但它们存在计算成本高和在分歧序列上性能差等局限性。在本研究中,我们探索了基于嵌入的相似性搜索方法,这些方法学习超越原始序列比对的潜在表示,以捕获更深层的结构和功能模式。我们在具有生物学意义的基因嵌入上系统评估了两个最先进的向量搜索库FAISS和ScaNN。与以往研究不同,我们的分析聚焦于生物信息学专用的嵌入,并评估了它们在检测新序列方面的效用,包括来自未表征分类群或缺乏已知同源物的基因的序列。我们的结果突出了其在计算上的优势(内存和运行时效率)以及检索质量的提升,为传统重度依赖比对的工具提供了有前景的替代方案。
引用
@article{arxiv.2507.16978,
title = {Fast and Scalable Gene Embedding Search: A Comparative Study of FAISS and ScaNN},
author = {Mohammad Saleh Refahi and Gavin Hearne and Harrison Muller and Kieran Lynch and Bahrad A. Sokhansanj and James R. Brown and Gail Rosen},
journal= {arXiv preprint arXiv:2507.16978},
year = {2025}
}