中文

Bio2Token:使用 Mamba 对任意生物分子结构进行原子级分词

机器学习 2025-04-10 v3 人工智能

摘要

高保真地对大规模三维分子结构进行高效编码与表征是生物分子设计应用的关键需求。尽管如此,许多表征学习方法仍限制于建模较小系统或使用系统粗糙近似,例如将蛋白质建模为氨基酸残基级别而非单个原子级别。为此,我们开发了量化自编码器,学习蛋白质、RNA 和小分子结构的原子级分词,复原精度远低于 1 埃。我们展示,一个简单的 Mamba 状态空间模型架构相较于 SE(3)-不变 IPA 架构更高效,精度相当,可扩展至近 10 万原子的系统。所学得的生物分子结构标记可能作为未来所有原子级生成模型的输入。

关键词

引用

@article{arxiv.2410.19110,
  title  = {Bio2Token: All-atom tokenization of any biomolecular structure with Mamba},
  author = {Andrew Liu and Axel Elaldi and Nathan Russell and Olivia Viessmann},
  journal= {arXiv preprint arXiv:2410.19110},
  year   = {2025}
}