SpecMER: 基于 K-mer 引导投机解码的快速蛋白质生成
机器学习
2025-09-29 v1
摘要
自回归模型通过生成超越自然界存在的新型蛋白质序列, 彻底改变了蛋白质工程. 然而, 其顺序推理引入了显著的延迟, 限制了其在高通量蛋白质筛选中的应用. 投机解码通过采用轻量级草稿模型采样 token, 随后由较大的目标模型进行验证和细化, 从而加速生成过程. 然而, 在蛋白质序列生成中, 草稿模型通常对目标蛋白的结构和功能约束不敏感, 导致生物学上不合理的输出以及生成序列似然分布的偏移. 我们引入了 SpecMER (Speculative Decoding via k-mer Guidance), 这是一个新颖的框架, 利用从多序列比对中提取的 k-mer 基序来融入生物学、结构和功能先验. 通过并行对候选序列进行评分并选择与已知生物学模式最一致的序列, SpecMER 在保持投机解码效率的同时, 显著提高了序列的合理性. SpecMER 比标准自回归解码实现了 24-32% 的加速, 同时具有更高的接受率和改进的序列似然.
引用
@article{arxiv.2509.21689,
title = {SpecMER: Fast Protein Generation with K-mer Guided Speculative Decoding},
author = {Thomas Walton and Darin Tsui and Aryan Musharaf and Amirali Aghazadeh},
journal= {arXiv preprint arXiv:2509.21689},
year = {2025}
}
备注
Accepted as spotlight at NeurIPS 2025