中文

具有目标氨基酸组成的蛋白质序列生成的两阶段微调

机器学习 2026-06-26 v1 人工智能 生物大分子 基因组学

摘要

蛋白质语言模型是生物序列生成的标准先验,但将它们导向明确的分布设计目标在很大程度上仍未探索。我们研究了一个受约束的蛋白质生成问题,其中序列必须匹配期望的氨基酸(AA)组成谱,同时保持合理的序列统计和多样性。激励应用是合成饲料蛋白设计,其中膳食蛋白质的AA组成直接决定其营养价值。我们提出了一个两阶段流水线,其中在域内蛋白质数据集上的域自适应微调(FT)之后,通过强化学习(RL)进行迭代奖励加权微调,并以FT模型作为冻结参考进行锚定。我们在两个AA组成上评估了该流水线,发现FT使平均组成接近目标,而随后的RL强制执行了FT单独无法满足的特定序列约束。我们还针对两个基线和消融变体评估了所提出的组成奖励项的设计选择,隔离了每个训练阶段的贡献,并验证了AA组成对齐是在不降低序列质量的情况下实现的。

关键词

引用

@article{arxiv.2606.27939,
  title  = {Two-Stage Fine-Tuning for Protein Sequence Generation with Targeted Amino-Acid Composition},
  author = {Violeta Basten-Romero and Rubén Muñoz-Tafalla and Anna María Díaz-Rovira and Bertran Miquel-Oliver and Isaac Filella-Merce and Víctor Guallar},
  journal= {arXiv preprint arXiv:2606.27939},
  year   = {2026}
}

备注

17 pages, 5 figures, ICML 2026 Workshop GenBio