中文

如何最大化利用掩码语言模型进行蛋白工程

机器学习 2026-05-08 v2 定量方法

摘要

近年来已发布大量蛋白语言模型,但相对较少有工作探讨如何从这些模型中进行采样以优化特定生物学性质。我们填补这一空白,通过提出一种灵活且有效的掩码语言模型(MLM)采样方法,并在实际抗体治疗项目中进行了系统评估。首先,我们提出了基于随机束搜索的采样方法,利用MLM在整个1-edit邻域序列的伪perplexity评估方面异常高效。将生成重新表述为整个序列评估,使我们能够灵活地使用多个优化目标进行引导。其次,我们报告了在抗体工程场景下的广泛体外对标评估结果。这一发现表明,采样方法的选择对模型使用的影响至少与模型本身一样重要,激励未来在这一被低估的领域进行研究。

关键词

引用

@article{arxiv.2603.10302,
  title  = {How to make the most of your masked language model for protein engineering},
  author = {Calvin McCarter and Nick Bhattacharya and Sebastian W. Ober and Hunter Elliott},
  journal= {arXiv preprint arXiv:2603.10302},
  year   = {2026}
}

备注

Accepted into the GEM Workshop, ICLR 2026