中文

流自编码器是有效的蛋白质分词器

机器学习 2025-10-02 v1 生物大分子

摘要

蛋白质结构分词器使得创建融合蛋白质结构、序列和功能的多模态模型成为可能。当前的蛋白质结构分词方法依赖于对空间对称性保持不变的特殊组件,但这些组件难以优化和扩展。我们提出了Kanzi,一种用于蛋白质结构分词和生成的基于流的分词器。Kanzi由一个使用流匹配损失训练的扩散自编码器组成。我们表明这种方法简化了蛋白质结构分词器的几个方面:基于框架的表示可以被全局坐标取代,复杂的损失可以被单个流匹配损失取代,SE(3)不变注意力操作可以被标准注意力取代。我们发现这些变化稳定了参数高效模型的训练,这些模型在以极小的模型规模和训练成本下,在重构指标上优于现有的分词器。使用Kanzi训练的自回归模型优于在token上操作的类似生成模型,尽管它尚未达到最先进的连续扩散模型的性能。代码可在此处获取:https://github.com/rdilip/kanzi/。

关键词

引用

@article{arxiv.2510.00351,
  title  = {Flow Autoencoders are Effective Protein Tokenizers},
  author = {Rohit Dilip and Evan Zhang and Ayush Varshney and David Van Valen},
  journal= {arXiv preprint arXiv:2510.00351},
  year   = {2025}
}