中文

基于生物学引导的自我改进模仿:在Oracle预算约束下进行蛋白设计

机器学习 2026-05-27 v1 人工智能 定量方法

摘要

在严格的Oracle预算下,蛋白序列优化需要探索广泛的组合空间,同时使每个评估都具有信息性。现有的强化学习和离策略生成方法常常在代理噪声下退化,位置无关的突变提议风险破坏功能关键残基。我们引入SILO,一个面向Oracle预算蛋白设计的轨迹级自我改进模仿框架。SILO使用分层编辑策略,将每个突变分解为位置选择和残基选择。在每个主动学习轮次中,策略通过无替换的递增蒙特色搜索(SBS)对候选轨迹进行采样,UCB-based代理ensemble结合阿尔法林扫描适度得分(AFS)选择具有功能相关编辑的候选对象进行体内Oracle评估。然后,通过对该轮最佳Oracle标记轨迹的下一个动作交叉熵模仿来更新策略,避免价值函数估计。在八个再现的蛋白适度景观和五个来自前期工作的强大基准上,SILO在8个景观上实现了最高的最大值和top-100平均适度,常常表现出更快的早期阶段改进。在低数据和噪声代理压力测试中,SILO在两个景观上的表现仍然具有竞争力或领先,尽管多个基准退化。消融实验表明,SBS与AFSaccount for much of the gains,迭代模仿提供额外的改进。代码可在https://github.com/grimmlab/SILO.git获得。

关键词

引用

@article{arxiv.2605.26690,
  title  = {Self-Improvement Imitation with Biologically Guided Search for Protein Design Under Oracle Budgets},
  author = {Ashima Khanna and Dominik Grimm},
  journal= {arXiv preprint arXiv:2605.26690},
  year   = {2026}
}