中文

Bio-xLSTM:生物与化学序列的生成建模、表征与上下文学习

生物大分子 2024-11-08 v1 人工智能 机器学习

摘要

用于生物和化学序列的语言模型在药物发现、蛋白质工程和精准医学等应用中发挥着关键作用。目前,这些语言模型主要基于Transformer架构。尽管Transformer取得了令人瞩目的结果,但其对序列长度的二次运行时依赖关系使其在长基因组序列以及蛋白质和化学序列的上下文学习中的应用变得复杂。最近,循环xLSTM架构在自然语言处理领域已被证明优于Transformer和现代状态空间模型(SSM)架构。与SSM类似,xLSTM对序列长度具有线性运行时依赖关系,并允许推理时恒定内存解码,这使其成为建模生物和化学序列中长程依赖关系的热门候选。在这项工作中,我们针对这些领域定制了xLSTM,并提出了一套称为Bio-xLSTM的架构变体。在三个大型领域——基因组学、蛋白质和化学——进行了广泛实验,以评估xLSTM对生物和化学序列的建模能力。结果表明,基于Bio-xLSTM的模型a)可以作为DNA、蛋白质和化学序列的熟练生成模型,b)学习这些模态的丰富表征,c)可以对蛋白质和小分子进行上下文学习。

关键词

引用

@article{arxiv.2411.04165,
  title  = {Bio-xLSTM: Generative modeling, representation and in-context learning of biological and chemical sequences},
  author = {Niklas Schmidinger and Lisa Schneckenreiter and Philipp Seidl and Johannes Schimunek and Pieter-Jan Hoedt and Johannes Brandstetter and Andreas Mayr and Sohvi Luukkonen and Sepp Hochreiter and Günter Klambauer},
  journal= {arXiv preprint arXiv:2411.04165},
  year   = {2024}
}