面向序列优化的赌博机理论与Thompson采样引导的定向进化
机器学习
2022-06-07 v1 机器学习
摘要
定向进化(DE)是起源于1960年代的标志性湿实验室方法,通过演化候选序列种群实现新蛋白质设计的发现。生物技术的近期进展使得收集高通量数据成为可能,从而允许使用机器学习刻画蛋白质的序列-功能关系。机器学习辅助DE用于加速蛋白质优化的兴趣日益增长。然而对DE的理论理解以及机器学习在DE中的使用仍有限。本文中,我们将DE与赌博机学习理论相联系,并首次尝试研究DE中的后悔最小化。我们提出一种Thompson采样引导的定向进化(TS-DE)框架用于序列优化,其中序列-函数映射未知且查询单个值需承受昂贵且含噪的测量。TS-DE基于收集的测量更新函数的后验。其使用后验采样函数估计来引导DE中的交叉重组与突变步骤。在线性模型情形下,我们证明TS-DE享有阶为的贝叶斯后悔,其中为特征维数、为种群大小、为轮数。该后悔界近乎最优,证实赌博机学习可证明地加速DE。这可能对更一般的序列优化与进化算法具有启示。
引用
@article{arxiv.2206.02092,
title = {Bandit Theory and Thompson Sampling-Guided Directed Evolution for Sequence Optimization},
author = {Hui Yuan and Chengzhuo Ni and Huazheng Wang and Xuezhou Zhang and Le Cong and Csaba Szepesvári and Mengdi Wang},
journal= {arXiv preprint arXiv:2206.02092},
year = {2022}
}