中文

扩展 ESM2 架构以分析长蛋白质序列:长序列与量化方法

机器学习 2025-01-15 v1 定量方法

摘要

利用 Transformer 架构的各种方法在自然语言处理(NLP)中取得了最先进的结果。基于这一成功,人们提出了许多适用于其他类型数据的架构,例如生物学领域,特别是蛋白质序列。其中值得注意的是 ESM2 架构,它在数十亿种蛋白质上进行了预训练,构成了该领域各种最先进方法的基础。然而,ESM2 架构在输入大小方面存在限制,将其限制为 1,022 个氨基酸,这 necessitates 使用预处理技术来处理超过此限制的序列。在本文中,我们提出了 ESM2 架构的长序列和量化版本,将输入大小限制翻倍至 2,048 个氨基酸。

关键词

引用

@article{arxiv.2501.07747,
  title  = {Scaling Up ESM2 Architectures for Long Protein Sequences Analysis: Long and Quantized Approaches},
  author = {Gabriel Bianchin de Oliveira and Helio Pedrini and Zanoni Dias},
  journal= {arXiv preprint arXiv:2501.07747},
  year   = {2025}
}