复用蛋白质语言模型用于基于潜在流的适应性度优化
机器学习
2026-02-03 v1 定量方法
摘要
蛋白质适应性度优化面临巨大的组合景观,高适应性变体极稀疏。许多当前方法要么表现不佳,要么需要计算昂贵的梯度采样。我们提出了 CHASE 框架,通过压缩预训练蛋白质语言模型的嵌入到紧凑的潜在空间,复用其演化知识。通过训练带有分类器自由指导的条件流匹配模型,我们实现在 ODE 采样步骤中直接生成高适应性变体,而无需基于预测器的指导。CASE 在 AAV 和 GFP 蛋白设计基准测试中实现了最新性能。最后,我们展示,在数据受限的设置中,使用合成数据进行引导可进一步提升性能。
引用
@article{arxiv.2602.02425,
title = {Repurposing Protein Language Models for Latent Flow-Based Fitness Optimization},
author = {Amaru Caceres Arroyo and Lea Bogensperger and Ahmed Allam and Michael Krauthammer and Konrad Schindler and Dominik Narnhofer},
journal= {arXiv preprint arXiv:2602.02425},
year = {2026}
}