中文

通过自蒸馆微调蛋白语言模型以提高其在蛋白设计中的通用性

机器学习 2025-12-11 v1 计算工程、金融与科学

摘要

监督式微调(SFT)是适应大型语言模型以专门领域为标准方法,但其应用于蛋白质序列建模与蛋白质语言模型(PLMs)仍显得不成熟。这部分原因在于针对蛋白质获得高质量标注数据比自然语言更为困难。我们提出一种简单通用的SFT微调PLMs的配方,旨在提高生成蛋白质序列的保真度、可靠性与新颖性。与现有方法需要为SFT准备高成本的实验数据不同,我们的方法利用PLMs自身,将轻量级数据清洗管道与特定领域过滤器相结合,以构建高质量训练数据。这些过滤器可以独立地细化PLMs的输出并识别用于体外评估的候选序列;当与SFT结合使用时,可使PLMs生成更稳定、更具功能的酶,同时将探索蛋白质序列空间的范围拓展到自然变体之外。虽然该方法对蛋白质语言模型(PLM)和蛋白质系统的选择具有惰性,我们以规模基因组的PLMs(GenSLM)应用于色氨酸酶酶家族,展示了其有效性。经监督式微调的模型生成的序列不仅更具新颖性,而且在针对性设计约束和显现蛋白质特性措施方面表现出改进的特征。

关键词

引用

@article{arxiv.2512.09329,
  title  = {Self Distillation Fine-Tuning of Protein Language Models Improves Versatility in Protein Design},
  author = {Amin Tavakoli and Raswanth Murugan and Ozan Gokdemir and Arvind Ramanathan and Frances Arnold and Anima Anandkumar},
  journal= {arXiv preprint arXiv:2512.09329},
  year   = {2025}
}