中文

Lyra:一种用于生物序列建模的高效且富有表达力的次二次架构

机器学习 2025-03-21 v1 基因组学

摘要

卷积神经网络和 Transformers 等深度学习架构彻底改变了生物序列建模,最近的进展得益于基础模型和特定任务模型的规模扩大。然而,所需的计算资源和海量数据集限制了它们在生物学背景下的适用性。我们引入了 Lyra,一种用于序列建模的次二次架构,其基于理解序列到功能关系之上位性(epistasis)的生物学框架。在数学上,我们证明了状态空间模型能有效捕捉全局上位性相互作用,并将其与投影门控卷积相结合以建模局部关系。我们展示了 Lyra 在 100 多项广泛的生物学任务中表现优异,在许多关键领域实现了最先进的(SOTA)性能,包括蛋白质适应度景观预测、生物物理性质预测(例如无序蛋白质区域功能)、肽工程应用(例如抗体结合、细胞穿透肽预测)、RNA 结构分析、RNA 功能预测以及 CRISPR 向导设计。与近期的生物学基础模型相比,它在推理速度上实现了数个数量级的提升,并在参数量上大幅减少(在我们的测试中减少高达 120,000 倍)。使用 Lyra,我们能够在两小时内在两个或更少的 GPU 上训练并运行本研究中的所有任务,实现了 SOTA 性能下生物序列建模的大众化,并有望应用于众多领域。

关键词

引用

@article{arxiv.2503.16351,
  title  = {Lyra: An Efficient and Expressive Subquadratic Architecture for Modeling Biological Sequences},
  author = {Krithik Ramesh and Sameed M. Siddiqui and Albert Gu and Michael D. Mitzenmacher and Pardis C. Sabeti},
  journal= {arXiv preprint arXiv:2503.16351},
  year   = {2025}
}

备注

53 pages, 5 figures